返回
An exploratory study on LLM-generated code and comments in code repositories
DOI:10.1016/j.jss.2026.113026.png)
摘要
En 中文
LLM在软件开发中的应用已日益广泛,涉及代码生成和总结等任务。大型科技公司报告显示,约20%至30%的代码由LLM生成。然而,关于LLM生成代码和注释的实际使用仍存在疑虑,例如担心调试生成代码需要更多时间以及生成注释的不自然性。本文研究了被检测为可能由LLM生成的代码和注释及其特征,公司维护和社区维护仓库之间的差异,以及与LLM生成代码相关的错误可能性。我们于2021年至2025年间对活跃的公司和社区维护仓库进行了广泛实验,使用了多种检测LLM生成代码和注释的工具和技术。基于我们的基于检测器的代理分析,结果表明被检测为可能由LLM生成的代码随时间减少,并频繁出现在测试用例中,而注释则相对稳定。代理结果进一步表明,被检测为可能由LLM生成的代码显示出大量的仓库内代码克隆,而注释中语法正确的句子比例相对较低。此外,公司维护仓库中检测为可能由LLM生成的代码和注释比例更高,且只有少数人工标记的错误被检测为可能与LLM生成代码相关。
Keyword:
LLM-generated detection on code and comments
Empirical study
Bug analysis
Code clone detection

