arrow
返回

Oversampling method using large language model for malicious JavaScript code detection

delete2026-08-01
delete0
PRE
AI
M
Mamoru Mimura *
D
Danjo, Shinjiro
DOI:10.1016/j.engappai.2026.115821delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
网站恶意JavaScript代码的检测仍然是一个重要问题。基于机器学习模型的检测方法已被提出用于实时检测这些攻击。在定向攻击中,恶意软件通常为特定组织定制。为防御这些攻击,机器学习模型必须从小数量的历史恶意样本中进行训练。应用于JavaScript的传统过采样技术未能恰当表示代码的语义和语法。因此,生成的样本可能无法准确反映实际恶意JavaScript代码的特征。为解决此问题,我们提出了一种使用CodeLlama(一种专门用于代码生成的大型语言模型)对恶意JavaScript代码进行过采样的方法。我们构建了一个由通过爬取URL收集的21,744个良性JavaScript代码和按收集年份分类的8,000个公开恶意JavaScript代码组成的不平衡数据集,并评估了所提方法的准确性。应用过采样后,我们方法的召回率比现有方法高出约0.22,比无过采样的基线高出约0.21。此外,我们证明了该方法通过应用于分类和特征提取过程均能提高准确率,且原始样本与过采样样本的最优比例约为1:1至1:2。
Keyword:
Oversampling
Large language model
CodeLlama-Instruct
JavaScript

期刊

Engineering Applications of Artificial Intelligence 封面图
Engineering Applications of Artificial Intelligence
IF:
8
论文数:
5.7K
被引数:
3.5W

机构

N
National Defense Academy
学者数:
12
论文数: 6
被引数: 0
引用论文

引用论文

暂无论文信息