arrow
返回

Analyzing and fixing code generation errors of foundation large language models

delete2026-09-25
delete0
PRE
AI
文
文浩 (Hao Wen)
Y
Yueheng Zhu
C
Chao Liu *
X
Xiaoxue Ren
W
Weiwei Du
M
Meng Yan
H
Hongyu Zhang
DOI:10.1007/s10664-026-10958-5delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
利用基础大语言模型(基础LLMs)如CodeLlama的代码生成,能够自动生成具有预期功能的源代码。该技术已在智能编程助手(如GitHub Copilot)中得到广泛研究和应用,以提升软件开发生产力和减少重复性任务。尽管基础LLMs取得了进展,但代码生成仍涉及大量错误。现有研究利用静态分析工具(如TBar和ReCoder)或增加额外的修复LLM(如CoR和LDB)对错误进行后处理。然而,仍有许多错误未解决,且现有研究未系统性地探究基础LLMs的代码生成错误。本文旨在理解基础LLMs的代码生成错误,并探索解决可直接修复错误的方案。具体而言,我们在14种基础LLMs(如CodeLlama)上对HumanEval基准进行测试,收集了12,837个错误。通过Python内置异常类型和手动分析,将这些错误分为14个类别和19种错误原因。随后,我们建立了三条标准来评估错误的可修复性。我们识别出三种可直接修复的错误:缺失导入、函数溢出和不一致缩进。基于错误分析,我们设计了LlmFix修复方法,并构建了LlmErrorEval数据集。通过在收集的错误数据集LlmErrorEval上评估LlmFix,我们发现LlmFix能有效修复几乎所有识别出的可直接修复错误,且可与其它LLM-based修复方法结合使用,而不会引入额外的时间和计算资源开销,因为LlmFix每次修复仅需11.50 ms。最后,我们使用LlmFix修复了14种基础LLMs和6种近期基础LLMs在HumanEval和MBPP数据集上的错误。结果显示,LlmFix分别带来了17.40%和12.39%的相对性能提升。
Keyword:
Foundation large language models
Function-level code generation
Automatic error fixing

期刊

Empirical Software Engineering 封面图
Empirical Software Engineering
IF:
3.6
论文数:
2.0K
被引数:
5.3K

机构

C
chongqing university
学者数:
2.8K
论文数: 842
被引数: 0
学者 查看更多机构
引用论文

引用论文

err
IF0
err
err0
PREAI
err
err分享
err收藏