返回
Analyzing the performance of large language models on statement-level code summarization
DOI:10.1007/s10489-026-07214-0.png)
摘要
En 中文
代码总结提供代码的简洁描述,涵盖功能、逻辑和用法,这对于提高代码质量和可维护性至关重要。大型语言模型(LLMs)的最新进展在该任务中表现出强大的性能,逐渐取代了传统的深度学习方法。然而,大多数研究集中在函数级代码总结上,而语句级代码总结则研究不足。语句级代码总结描述代码中关键语句的功能,并在理解函数和类等更高层代码单元方面发挥着重要作用。然而,由于高度依赖上下文和其他因素,该任务面临挑战。本文评估了LLMs在语句级代码总结中的应用,重点关注数据集构建、注释生成和自动评估。我们通过将函数作为上下文并结合基于规则的过滤和相关工具创建了一个高质量的数据集。在数据集构建过程中,我们使用LLMs验证了代码-注释对的一致性,导致排除了60%的低质量数据。在比较实验中,使用函数作为上下文显著提高了所有指标的性能,BLEU分数提高了25.04%。接下来,我们测试了主流的提示方法,其中少样本方法优于其他方法,在自动指标评估和人工评估中均表现出色。最后,我们在自动评估中测试了LLMs,发现其与人工评估具有强正相关性和一致性,突显了它们作为自动评估新方法的潜力。
Keyword:
Large language models
Code summarization
Statement-level code summarization
期刊
IF:
3.5
论文数:
7.6K
被引数:
1.7W
机构
引用论文
More Samples or More Prompts? Exploring Effective Few-Shot In-Context Learning for LLMs with In-Context Sampling更多样本还是更多提示?探索使用上下文采样进行有效的少样本上下文学习 for LLMs
Weighted kappa: Nominal scale agreement provision for scaled disagreement or partial credit.加权kappa: 针对规模分歧或部分信贷的名义规模协议条款。
What Makes Good In-Context Demonstrations for Code Intelligence Tasks with LLMs?使用LLMs进行代码智能任务的良好上下文演示的原因是什么?
Are we building on the rock? on the importance of data preprocessing for code summarization我们是在岩石上建造吗?论数据预处理对代码总结的重要性
CodeT5: Identifier-aware Unified Pre-trained Encoder-Decoder Models for Code Understanding and GenerationCodeT5: 用于代码理解和生成的标识符感知的统一预训练编码器-解码器模型

