返回
Using Large Language Models for multi-level commit message generation for large diffs
DOI:10.1016/j.infsof.2025.107831.png)
摘要
En 中文
提交信息在版本控制系统(VCS)中发挥着关键作用,为代码库中的变更提供必要的上下文和解释。尽管其重要性,许多提交信息编写质量低下或完全缺失,导致代码理解、错误追踪和项目维护面临挑战。本文针对现有自动生成提交信息方法中的两大显著问题:使用短长度数据集的局限性以及依赖单一提交信息涵盖多文件变更的依赖。为克服这些挑战,我们使用最新的大型语言模型(LLMs),包括GPT-4o、Llama 3.1 70B & 8B和Mistral Large,为具有较大标记长度的差异(diffs)生成提交信息。在评估中,我们采用BLEU、ROUGE、METEOR和CIDEr等指标进行自动评估,并进行人工评估。我们的研究发现,GPT-4o和Llama 3.1 70B是生成提交信息的最佳模型。此外,我们提出了一种两级方法,生成整体提交信息以及针对每个文件变更的文件特定信息。为验证此方法,我们调查了开发者以了解他们当前提交信息所面临的问题,并收集了他们对两级方法的反馈。我们的调查表明,两级方法有效,并有助于开发者更好地理解复杂且冗长的代码差异。
期刊
IF:
4.3
论文数:
3.8K
被引数:
7.7K
机构
引用论文
CoreGen: Contextualized Code Representation Learning for Commit Message Generation
NEUROCOMPUTING
IF6.5
Automatic Commit Message Generation: A Critical Review and Directions for Future Work自动提交消息生成: 关键回顾和未来工作方向
Automating Dependency Updates in Practice: An Exploratory Study on GitHub Dependabot在实践中自动更新依赖项: GitHub Dependabot上的探索性研究

