arrow
返回

Analyzing the performance of large language models on statement-level code summarization

delete2026-05-16
delete0
PRE
AI
J
Jie Zhu
Z
Zhihui Wang
T
Tingting Xu
J
Junwu Zhu *
Y
Yonglong Zhang
DOI:10.1007/s10489-026-07214-0delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
代码总结提供代码的简洁描述,涵盖功能、逻辑和用法,这对于提高代码质量和可维护性至关重要。大型语言模型(LLMs)的最新进展在该任务中表现出强大的性能,逐渐取代了传统的深度学习方法。然而,大多数研究集中在函数级代码总结上,而语句级代码总结则研究不足。语句级代码总结描述代码中关键语句的功能,并在理解函数和类等更高层代码单元方面发挥着重要作用。然而,由于高度依赖上下文和其他因素,该任务面临挑战。本文评估了LLMs在语句级代码总结中的应用,重点关注数据集构建、注释生成和自动评估。我们通过将函数作为上下文并结合基于规则的过滤和相关工具创建了一个高质量的数据集。在数据集构建过程中,我们使用LLMs验证了代码-注释对的一致性,导致排除了60%的低质量数据。在比较实验中,使用函数作为上下文显著提高了所有指标的性能,BLEU分数提高了25.04%。接下来,我们测试了主流的提示方法,其中少样本方法优于其他方法,在自动指标评估和人工评估中均表现出色。最后,我们在自动评估中测试了LLMs,发现其与人工评估具有强正相关性和一致性,突显了它们作为自动评估新方法的潜力。
Keyword:
Large language models
Code summarization
Statement-level code summarization

期刊

Applied Intelligence 封面图
Applied Intelligence
IF:
3.5
论文数:
7.6K
被引数:
1.7W

机构

C
City University of Macau
学者数:
552
论文数: 382
被引数: 2.5K
Y
yangzhou university
学者数:
9.3K
论文数: 2.9K
被引数: 2
引用论文

引用论文

BLEU布卢
err2001-01-01
err0
errOAAI
errKishore Papineni; Salim Roukos; Todd Ward; Wei-Jing Zhu
err分享
err收藏
学者 查看更多内容