arrow
返回

Synthetic Malware at Scale: Malicious Code Generation With Code Transplanting

delete
delete0
PRE
AI
G
Guangzhan Wang
D
Diwei Chen
X
Xiaodong Gu
Y
Yuting Chen
B
Beijun Shen
DOI:10.1109/TSE.2025.3633280delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
恶意代码检测是防范安全漏洞、数据泄露及相关威胁的最基本任务之一。尽管机器学习已作为模式检测的主流方法出现,但训练过程因恶意代码样本的严重匮乏而复杂化。因此,机器学习检测器通常在有限且孤立的场景中遇到恶意模式,阻碍了其跨多样化威胁环境的有效泛化能力。本文介绍了MalCoder,一种合成恶意代码样本的新方法。MalCoder通过将一组恶意原型移植到庞大的良性代码库中,扩大了恶意实例的数量和多样性,从而创建出针对不同应用场景定制的多样化恶意实例集。对于每个恶意原型,MalCoder将其视为不完整的代码片段,并通过从右到左和从左到右的代码补全分别构建其前置和后置上下文。通过利用具有不同采样策略的GPTs,我们可以实例化大量包含恶意原型的代码样本。随后,MalCoder掩码移植样本中的原始原型,并微调一个大型语言模型(LLM)代码生成器以重建原始原型。此过程使模型能够无缝地将恶意代码片段移植到良性代码中。在推理阶段,MalCoder可自动在良性样本的随机位置插入恶意片段,将良性代码转化为恶意代码。我们将MalCoder应用于CodeSearchNet中的大量良性代码库,并生成了源自39个恶意原型的50,000余个恶意样本。定性和定量分析表明,生成的样本既保留了恶意代码的关键特征,又能与良性代码无缝融合,有助于创建真实且多样化的训练数据。此外,通过将生成的样本作为增强训练数据使用,我们观察到恶意代码检测能力显著提升。具体而言,与仅使用原始原型样本相比,F1分数实现了显著提高。
Keyword:
Malicious code generation
malicious code detection
code transplanting
program generation

期刊

IEEE Transactions on Software Engineering 封面图
IEEE Transactions on Software Engineering
IF:
5.6
论文数:
2.8K
被引数:
1.1W

机构

S
shanghai jiao tong university
学者数:
15.7W
论文数: 11.7W
被引数: 159
引用论文

引用论文

err分享
err收藏
Intriguing Properties of Adversarial ML Attacks in the Problem Space
err2020-05-01
err0
errOAAI
errFabio Pierazzi; Feargus Pendlebury; Jacopo Cortellazzi; Lorenzo Cavallaro
err分享
err收藏
On the Naturalness of Software论软件的自然性
err2016-04-26
err164
PREAI
errHindle, Abram; Barr, Earl T.; Gabel, Mark; Su, Zhendong; Devanbu, Premkumar
err分享
err收藏
err分享
err收藏
MAB-Malware
err2022-05-30
err0
errOAAI
errWei Song; Xuezixiang Li; Sadia Afroz; Deepali Garg; Dmitry Kuznetsov; Heng Yin
err分享
err收藏
学者 查看更多内容