返回
Identifying and Mitigating API Misuse in Large Language Models
DOI:10.1109/TSE.2026.3651566.png)
摘要
En 中文
大型语言模型(LLMs)生成的代码中存在的API误用问题,对软件开发构成了严重且日益增长的挑战。尽管LLMs展示了出色的代码生成能力,但它们与复杂库API的交互往往容易出错,可能导致软件故障和漏洞。本文对LLM生成的代码中的API误用模式进行了大规模研究,分析了Python和Java中的方法选择和参数使用情况,使用了三个代表性LLM(StarCoder-7B、Qwen2.5-Coder-7B和GitHub Copilot)。基于对3,209个方法级和3,492个参数级误用的广泛手动标注,我们借鉴并完善了现有的API误用分类体系,识别并分类了四种反复出现的误用类型。我们对三个广泛使用的LLM(StarCoder-7B、Qwen2.5-Coder-7B和GitHub Copilot)的评估揭示了API使用中持续存在的挑战,特别是幻觉现象和意图错位。为解决这些问题,我们提出了Dr.Fix,一种基于LLM的自动修复方法,该方法由我们的分类体系指导。Dr.Fix在基准数据集上相比基线提示和现有修复方法,将修复精度提高了最高38.4 BLEU和40%的完全匹配。这项工作为LLM在API使用方面的当前局限性提供了重要见解,并指出了改进代码生成系统中自动化误用修复的方向。
Keyword:
Codes
Taxonomy
Libraries
Maintenance engineering
Java
Software development management
Python
Large language models
Programming
Manuals
Code generation
large language model
API misuse
automatic program repair
empirical software engineering
期刊
IF:
5.6
论文数:
2.8K
被引数:
1.1W

