arrow
返回

Context-aware code summary generation

delete2025-08-06
delete0
PRE
AI
C
Chia‐Yi Su *
A
Aakash Bansal
Y
Yu Huang
T
Toby Jia-Jun Li
C
Collin McMillan
DOI:10.1016/j.jss.2025.112580delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
近期大型语言模型(LLMs)的进展已使自动代码摘要成为现实。然而,这些方法生成的摘要往往仅关注代码的狭窄领域。其结果是生成的摘要虽然解释了该函数的内部功能,但缺乏对程序更广泛背景中其目的的描述。本文提出了一种将此上下文纳入最新LLM基代码摘要的方法。该方法以Java方法及其调用方法的摘要作为输入,输出为该方法的简洁英文目的描述。此方法的优势在于,我们使小模型的标记数量减少了81%。我们分两步训练该模型:首先从大型模型中蒸馏代码摘要知识,然后使用一项针对人类程序员的研究数据(要求他们编写代码摘要)对模型进行微调。我们以竞赛式人类研究评估了该方法,并分析了决策背后的原理。我们在人类研究中发现,对于此任务,人类程序员更偏好我们方法生成的摘要,而非GPT-4生成的摘要,且准确性是最常见的原因使得某个摘要优于其他摘要。在自动指标方面,我们也观察到USE评分提升了10%。
Keyword:
code summarization
large language models
context-aware summaries
model distillation
human evaluation

期刊

Journal of Systems and Software 封面图
Journal of Systems and Software
IF:
4.1
论文数:
5.4K
被引数:
8.4K

机构

U
University of Notre Dame
学者数:
1.2W
论文数: 1.1W
被引数: 1.7W
V
vanderbilt university
学者数:
5.1W
论文数: 4.1W
被引数: 59
L
Louisiana State University
学者数:
9.8K
论文数: 8.0K
被引数: 1.6W
学者 查看更多机构
引用论文

引用论文

暂无论文信息