返回
An Empirical Study of Test Code Summarization
DOI:10.1007/978-981-95-3483-8_24.png)
摘要
En 中文
测试代码是软件测试实践中的具体表现形式,也是项目代码的重要组成部分。良好的摘要有助于程序员快速理解测试代码。然而,我们发现现有的代码摘要任务常常忽视测试代码,将其视为自动生成的代码并从数据集中移除。因此,现有摘要模型-数据集组合在测试代码摘要任务上的性能未知。为了获取其性能并找到最佳的模型-数据集组合,我们进行了一项实证研究。该研究基于5个基于深度学习的模型、3个数据集和4个指标。具体而言,3个数据集包括两个不包含测试代码的常用数据集以及我们收集的第一个JUnit测试代码摘要数据集JTS。JTS包含从GitHub上的9,211个Java开源项目中提取的94,270个JUnit测试代码-摘要对。由于现有的摘要模型已经相当稳健,而数据集几乎都不包含测试代码,我们在研究中修改了数据集。具体来说,除了探索现有模型-数据集组合在测试代码摘要任务上的性能外,我们还进一步研究了切换到重新引入测试代码的数据集和专门的测试代码摘要数据集对性能的影响。实验结果表明,现有的模型-数据集组合并不适合测试代码摘要任务。而对于此任务,优选的模型-数据集组合方案是。
Keyword:
Software Testing
Test Code Summarization
Empirical Study
Deep Learning
Code Summarization Datasets
期刊
B
IF:
0
论文数:
29
被引数:
0
机构
引用论文
Are we building on the rock? on the importance of data preprocessing for code summarization我们是在岩石上建造吗?论数据预处理对代码总结的重要性
CodeT5: Identifier-aware Unified Pre-trained Encoder-Decoder Models for Code Understanding and GenerationCodeT5: 用于代码理解和生成的标识符感知的统一预训练编码器-解码器模型

