返回
Foundation models as oracles for refactoring correctness detection
DOI:10.1007/s10664-026-10951-y.png)
摘要
En 中文
在流行的集成开发环境(IDE)中,重构工具可能会引入意外的行为变化或编译错误,这是一个持续存在的挑战,削弱了开发人员对自动化转换的信任。传统的检测方法依赖于手工制作的先决条件以及静态和动态分析,但适应性有限,且可能遗漏微妙的正确性问题。本研究探讨了基础模型作为检测Java程序重构错误的“真理来源”的潜力。我们在过去十多年间从广泛使用的Java IDE(IntelliJ-IDEA、Eclipse和NetBeans)收集的226个真实重构错误上,评估了零样本提示(无需任务特定训练)的效果,这些错误涵盖了47种重构类型。我们的结果表明,基础模型在该任务上可能有效,尽管不同模型的性能存在差异。在首次运行设置中,GPT-OSS-20B达到80.5%的准确率,而GPT-5.4达到93.8%。我们还评估了其他开源权重和专有模型:Gemma-4-31B在开源权重模型中表现最佳,Gemini-3.1-Pro-Preview在所有评估模型中表现最佳。两个主要模型经过五次尝试评估,而其他模型则进行单次运行比较。形态变换测试表明,在测试的语义保持扰动下,模型预测基本保持一致,但这些结果应被视为鲁棒性证据,而非针对记忆或数据污染的证据。除检测准确率外,基础模型还能提供简短的解释,可能有助于支持开发人员检查,无需显式编码的重构特定规则即可跨重构类型运行,并可能作为开发工作流中的轻量级分类辅助工具。我们的发现表明,基础模型可以通过标记可疑转换以供开发人员检查,从而补充传统的重构检查。
Keyword:
Refactoring
Foundation models
Oracle
Behavior change
Compilation error
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
3.6
论文数:
2.0K
被引数:
5.3K

