arrow
返回

An ensemble-based hybrid framework for automated Programming Language Identification

delete2026-08-01
delete0
PRE
AI
J
Jayalaxmi, P. L. S.
A
Anthony, Immanuel
A
Arshad, Md.
A
Akshith, Jadhav
V
Vadhyar, Anirudh
R
Rahul Saha *
G
Gulshan Kumar
A
Alessandro Brighente
M
Mauro Conti
DOI:10.1016/j.array.2026.101110delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
编程语言识别(PLI)是许多软件工程任务的核心步骤,包括代码分析、软件维护、仓库索引和漏洞检测。大多数现有的PLI技术通过外部指标(如文件扩展名)或基于语法的统计模式匹配来推断语言。这些方法存在三个常见缺陷:它们依赖易缺失或误导的指标,混淆语法大部分相似的语言(例如C和C++,或Java和JavaScript),并且在处理短代码片段和多语言混合文件时性能下降。因此,实际准确性和适应性受限。为解决这些问题,我们提出了一种基于集成的混合框架,称为PrOgram LANguage Detection(POLAND)。该框架首先应用自然语言处理(NLP)预处理,使用自定义正则表达式分词器和词频-逆文档频率(TF-IDF)向量化器将原始代码转换为数值特征,强调语言特定标记而非共享标记。这些特征随后由三个互补的学习器并行分类——多层感知器(MLP)、随机森林(RF)和多项式朴素贝叶斯(MNB)模型——最终语言通过多数投票决定,少数预测作为候选语言以标记可能的混合语言代码。我们在包含36种编程语言的测试集上评估了POLAND,该数据集由从公共GitHub仓库收集的18种语言和从通用代码模板生成的18种语言组成,每种语言标准化为200个样本。在保留测试集下,集成模型达到约97%的平均准确率,各分类器的训练时间总和约为60秒(在普通工作站上)。我们讨论了难以区分的语言,分析了混淆来源,并概述了当前方法的局限性。
Keyword:
Programming Language Identification
Source code classification
Ensemble learning
Code tokenization
TF-IDF
Machine learning
Mixed-language detection

期刊

Array 封面图
Array
IF:
4.5
论文数:
926
被引数:
1.2K

机构

L
Lovely Professional University
学者数:
169
论文数: 86
被引数: 0
引用论文

引用论文

暂无论文信息