返回
DALO-APR: LLM-based automatic program repair with data augmentation and loss function optimization
DOI:10.1007/s11227-025-07102-3.png)
摘要
En 中文
自动程序修复(APR)随着T5和CodeT5等大型语言模型(LLMs)的出现取得了显著进展。然而,基于LLM的APR模型可能因训练数据多样性有限而依赖重复的修复模式,导致性能次优。此外,常见的损失函数(如交叉熵)可能无法充分优先考虑修复位置,或优化模型输出概率分布以偏好更准确的修复候选方案。为解决这些挑战,本文提出了一种基于LLM的APR方法,结合数据增强和损失函数优化(DALO-APR)。数据增强策略通过随机删除、插入、交换标记以及注入错误来扩展修复模式的多样性。优化的损失函数有助于模型对更准确的修复候选方案进行更高排名。在Java、JavaScript、Python和C数据集上的实验结果表明,DALO-APR提升了错误定位和漏洞修复能力。与基线模型相比,DALO-APR在多项指标上均有提升,尤其在100%准确率上提高了105.65%。
Keyword:
Automatic program repair
Large language models
Data augmentation
Loss function
期刊
IF:
2.7
论文数:
1.1K
被引数:
1.0W
机构
引用论文
An Empirical Study on Learning Bug-Fixing Patches in the Wild via Neural Machine Translation通过神经机器翻译在野外学习错误修复补丁的实证研究
CodeT5: Identifier-aware Unified Pre-trained Encoder-Decoder Models for Code Understanding and GenerationCodeT5: 用于代码理解和生成的标识符感知的统一预训练编码器-解码器模型

