返回
LLMs for Commit Messages: A Survey and an Agent-Based Evaluation Protocol on CommitBench
DOI:10.3390/computers14100427.png)
摘要
En 中文
提交信息对于现代软件项目的可追溯性、维护和入职至关重要,但其质量经常不一致。近期的大型语言模型(LLMs)能够将代码差异转换为自然语言摘要,为生成更一致且信息更丰富的提交信息提供了途径。本文做出了两项贡献:(i) 它提供了基于LLMs的自动提交信息生成的系统性综述,批判性地比较了仅提示、微调和检索增强等方法;(ii) 它指定了一个以CommitBench为中心的透明、基于代理的评估蓝图。与以往综述不同,我们包含了详细的 数据集审核、预处理影响、评估指标和错误分类。该协议定义了数据集使用和拆分、提示和上下文设置、评分和选择规则以及报告指南(按项目、语言和提交类型的结果),以及一个错误分类以指导定性分析。重要的是,这项工作强调方法论和设计,而不是呈现新的实证基准测试结果。该蓝图旨在支持未来研究的可重复性和可比性。
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
C
IF:
4.2
论文数:
1.4K
被引数:
3.3K
机构
暂无机构信息
引用论文
CoreGen: Contextualized Code Representation Learning for Commit Message Generation
NEUROCOMPUTING
IF6.5
Sultana, S.; Afreen, S.; Eisty, N.U. Code vulnerability detection: A comparative analysis of emerging large language models. arXiv 2024, arXiv:2409.10490. [Google Scholar] [CrossRef]Sultana, S.; Afreen, S.; Eisty, N.U. 代码漏洞检测:新兴大型语言模型的比较分析。arXiv 2024, arXiv:2409.10490. [Google Scholar] [CrossRef]
Automatic Commit Message Generation: A Critical Review and Directions for Future Work自动提交消息生成: 关键回顾和未来工作方向
Lopes, C.V.; Klotzman, V.I.; Ma, I.; Ahmed, I. Commit messages in the age of large language models. arXiv 2024, arXiv:2401.17622. [Google Scholar] [CrossRef]Lopes, C.V.; Klotzman, V.I.; Ma, I.; Ahmed, I. 大语言模型时代的提交信息。arXiv 2024, arXiv:2401.17622. [Google Scholar] [CrossRef]
Zhang, Q.; Fang, C.; Xie, Y.; Zhang, Y.; Yang, Y.; Sun, W.; Yu, S.; Chen, Z. A survey on large language models for software engineering. arXiv 2023, arXiv:2312.15223. [Google Scholar] [CrossRef]张, Q.; 方, C.; 谢, Y.; 张, Y.; 杨, Y.; 孙, W.; 于, S.; 陈, Z. 关于软件工程中大语言模型的综述. arXiv 2023, arXiv:2312.15223. [Google Scholar] [CrossRef]
Kolawole, I.; Fakokunde, A. Machine learning algorithms in DevOps: Optimizing software development and deployment workflows with precision. Int. J. Res. Publ. Rev. 2025, 2582, 7421. [Google Scholar] [CrossRef]Kolawole, I.; Fakokunde, A. 机器学习算法在DevOps中的应用:精确优化软件开发和部署工作流程。Int. J. Res. Publ. Rev. 2025, 2582, 7421. [Google Scholar] [CrossRef]
Bogomolov, E.; Eliseeva, A.; Galimzyanov, T.; Glukhov, E.; Shapkin, A.; Tigina, M.; Golubev, Y.; Kovrigin, A.; van Deursen, A.; Izadi, M.; et al. Long code arena: A set of benchmarks for long-context code models. arXiv 2024, arXiv:2406.11612. [Google Scholar] [CrossRef]Bogomolov, E.; Eliseeva, A.; Galimzyanov, T.; Glukhov, E.; Shapkin, A.; Tigina, M.; Golubev, Y.; Kovrigin, A.; van Deursen, A.; Izadi, M.; et al. Long code arena: 一组用于长上下文代码模型的基准测试。arXiv 2024, arXiv:2406.11612. [Google Scholar] [CrossRef]
Joshi, S. A review of generative AI and DevOps pipelines: CI/CD, agentic automation, MLOps integration, and large language models. Int. J. Innov. Res. Comput. Sci. Technol. 2025, 13, 1–14. [Google Scholar] [CrossRef]Joshi, S. 生成式AI和DevOps流水线的综述:CI/CD、代理自动化、MLOps集成及大型语言模型. 国际计算机科学与技术创新杂志. 2025, 13, 1–14. [Google Scholar] [CrossRef]
Cihan, U.; Haratian, V.; İçöz, A.; Gül, M.K.; Devran, O.; Bayendur, E.F.; Uçar, B.M.; Tüzün, E. Automated code review in practice. arXiv 2024, arXiv:2412.18531. [Google Scholar] [CrossRef]Cihan, U.; Haratian, V.; İçöz, A.; Gül, M.K.; Devran, O.; Bayendur, E.F.; Uçar, B.M.; Tüzün, E. 实践中的自动化代码审查。arXiv 2024, arXiv:2412.18531. [Google Scholar] [CrossRef]

