arrow
返回

Do Current Language Models Support Code Intelligence for R Programming Language?

delete2025-10-17
delete0
PRE
AI
Z
Zixiao Zhao
F
Fatemeh H. Fard
DOI:10.1145/3735635delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
近期在开发面向代码的预训练语言模型(Code-PLMs)方面的进展,已推动软件工程(SE)的多个领域,并为许多SE任务带来了突破性成果。尽管这些模型在Java、Python等热门编程语言的SE任务上达到了最佳性能,但科学软件及其相关语言(如R编程语言)却很少从Code-PLMs中获益,甚至未被评估。研究表明,R与其他编程语言存在诸多差异,需要特定技术。本研究首次为R的代码智能提供了见解。为此,我们收集并开源了一个R数据集,并通过多种设置和策略(包括Tidy-verse和Base R两种R风格差异)评估了Code-PLMs在代码摘要和函数名预测两项任务上的表现。结果显示,所研究的模型在处理R代码时性能出现了不同程度的下降,这一结论得到了人工评估的支持。此外,即使经过多语言微调,并非所有模型在R特定任务上都表现出性能提升。R的双语法范式显著影响了模型的性能,尤其是在代码摘要任务中。此外,R代码库中固有的项目特定上下文显著影响了跨项目训练的性能。有趣的是,即便使用CodeLlama和StarCoder2等大型语言模型进行代码生成,其Pass@K(\(K = 1,5,10\))结果仍远低于Python的得分。本研究表明,作为低资源语言,R需要不同的技术来收集高质量数据。具体区分两种R风格对结果影响巨大,且独立的数据集能提升模型性能。我们的研究揭示了Code-PLMs的能力,并为研究人员和从业者开发R的代码智能工具和技术开辟了新的研究方向。鉴于R的广泛应用和普及,本研究结果有望惠及学术界和工业界的广大R开发者社区。

期刊

A
ACM Transactions on Software Engineering and Methodology
IF:
6.2
论文数:
1.2K
被引数:
3.4K

机构

暂无机构信息
引用论文

引用论文

暂无论文信息