arrow
返回

Trained without My Consent: Detecting Code Inclusion in Language Models Trained on Code

delete2024-11-02
delete0
delete
OA
AI
M
Majdinasab, V
A
Amin Nikanjam
F
Foutse Khomh
DOI:10.1145/3702980delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
代码审计通过验证代码不包含受保护来源的代码,确保开发出的代码符合标准、法规和版权保护。大型语言模型(LLMs)作为软件开发过程中的编码助手,其近期出现为代码审计带来了新的挑战。这些模型的训练数据集主要收集自公开来源。这引发了知识产权侵权的问题,因为开发者的代码可能已被包含在数据集中。因此,审计使用LLMs开发的代码具有挑战性,因为难以可靠地断定开发过程中使用的LLM是否在特定版权代码上进行过训练,而我们无法访问这些模型的训练数据集。鉴于训练数据集的非公开性,传统方法(如代码克隆检测)不足以判定版权侵权。为应对这一挑战,我们提出了一种新的方法TraWiC;这是一种基于成员推理的模型无关且可解释的方法,用于检测LLM训练数据集中的代码包含情况。我们提取每个程序的独特语法和语义标识符,以训练一个检测代码包含的分类器。在我们的实验中,观察到TraWiC能够检测出83.87%用于训练LLM的代码。相比之下,主流的克隆检测工具NiCad仅能检测出47.64%。除出色性能外,TraWiC的资源开销远低于工具(如CodeWhisperer参考追踪器)审计过程中进行的成对克隆检测,其涉及数千个代码片段。
Keyword:
Large Language Models
Intellectual Property Infringement
Code Licensing
Dataset Inclusion Detection
Membership Inference Attack

期刊

A
ACM Transactions on Software Engineering and Methodology
IF:
6.2
论文数:
1.2K
被引数:
3.4K

机构

暂无机构信息
引用论文

引用论文

How Developers Choose Names开发人员如何选择名称
err2022-01-01
err23
errOAAI
errFeitelson, Dror G.; Mizrahi, Ayelet; Noy, Nofar; Ben Shabat, Aviad; Eliyahu, Or; Sheffer, Roy
err分享
err收藏
YAC transgene-mediated olfactory receptor gene choiceYAC转基因介导的嗅觉受体基因选择
err2000-02-01
err0
errOAAI
errFarah A.W. Ebrahimi; James Edmondson; Rodney Rothstein; Andrew Chess
err分享
err收藏
Parameter-efficient fine-tuning of large-scale pre-trained language models大规模预训练语言模型的参数高效微调
err2023-03-02
err139
errOAAI
errDing, Ning; Qin, Yujia; Yang, Guang; Wei, Fuchao; Yang, Zonghan; Su, Yusheng; Hu, Shengding; Chen, Yulin; Chan, Chi-Min; Chen, Weize; Yi, Jing; Zhao, Weilin; Wang, Xiaozhi; Liu, Zhiyuan; Zheng, Hai-Tao; Chen, Jianfei; Liu, Yang; Tang, Jie; Li, Juanzi; Sun, Maosong
err分享
err收藏
err分享
err收藏
学者 查看更多内容