返回
Trained without My Consent: Detecting Code Inclusion in Language Models Trained on Code
DOI:10.1145/3702980.png)
摘要
En 中文
代码审计通过验证代码不包含受保护来源的代码,确保开发出的代码符合标准、法规和版权保护。大型语言模型(LLMs)作为软件开发过程中的编码助手,其近期出现为代码审计带来了新的挑战。这些模型的训练数据集主要收集自公开来源。这引发了知识产权侵权的问题,因为开发者的代码可能已被包含在数据集中。因此,审计使用LLMs开发的代码具有挑战性,因为难以可靠地断定开发过程中使用的LLM是否在特定版权代码上进行过训练,而我们无法访问这些模型的训练数据集。鉴于训练数据集的非公开性,传统方法(如代码克隆检测)不足以判定版权侵权。为应对这一挑战,我们提出了一种新的方法TraWiC;这是一种基于成员推理的模型无关且可解释的方法,用于检测LLM训练数据集中的代码包含情况。我们提取每个程序的独特语法和语义标识符,以训练一个检测代码包含的分类器。在我们的实验中,观察到TraWiC能够检测出83.87%用于训练LLM的代码。相比之下,主流的克隆检测工具NiCad仅能检测出47.64%。除出色性能外,TraWiC的资源开销远低于工具(如CodeWhisperer参考追踪器)审计过程中进行的成对克隆检测,其涉及数千个代码片段。
Keyword:
Large Language Models
Intellectual Property Infringement
Code Licensing
Dataset Inclusion Detection
Membership Inference Attack
期刊
A
IF:
6.2
论文数:
1.2K
被引数:
3.4K
机构
暂无机构信息
引用论文
QSynth - A Program Synthesis based approach for Binary Code DeobfuscationQSynth - 一种基于程序合成的二进制代码去混淆方法
Khaos: The Impact of Inter-procedural Code Obfuscation on Binary Diffing TechniquesKhaos:跨过程代码混淆对二进制差异分析技术的影响

