返回
Context-aware code summary generation
DOI:10.1016/j.jss.2025.112580.png)
摘要
En 中文
近期大型语言模型(LLMs)的进展已使自动代码摘要成为现实。然而,这些方法生成的摘要往往仅关注代码的狭窄领域。其结果是生成的摘要虽然解释了该函数的内部功能,但缺乏对程序更广泛背景中其目的的描述。本文提出了一种将此上下文纳入最新LLM基代码摘要的方法。该方法以Java方法及其调用方法的摘要作为输入,输出为该方法的简洁英文目的描述。此方法的优势在于,我们使小模型的标记数量减少了81%。我们分两步训练该模型:首先从大型模型中蒸馏代码摘要知识,然后使用一项针对人类程序员的研究数据(要求他们编写代码摘要)对模型进行微调。我们以竞赛式人类研究评估了该方法,并分析了决策背后的原理。我们在人类研究中发现,对于此任务,人类程序员更偏好我们方法生成的摘要,而非GPT-4生成的摘要,且准确性是最常见的原因使得某个摘要优于其他摘要。在自动指标方面,我们也观察到USE评分提升了10%。
Keyword:
code summarization
large language models
context-aware summaries
model distillation
human evaluation
期刊
IF:
4.1
论文数:
5.4K
被引数:
8.4K
机构
引用论文
暂无论文信息

