返回
Multimodal information fusion for software vulnerability detection based on both source and binary codes
DOI:10.1016/j.scico.2025.103411.png)
摘要
En 中文
背景:许多研究者提出了通过分析程序来增强软件可靠性的漏洞检测方法。然而,仅从源代码中识别某些漏洞(尤其是与执行相关的漏洞)较为困难。目标:为解决此问题,本文引入额外的二进制代码,并基于多模态信息融合提出了一种新颖的软件漏洞检测解决方案。方法:该方法将源代码和二进制代码视为不同模态,并使用两个预训练模型作为特征提取器分别分析它们。随后,我们设计了一种基于注意力机制的信息融合策略,将源代码信息作为主体,二进制代码信息作为补充。该策略不仅能捕获跨模态特征间的相关性,还能在融合过程中过滤二进制代码的冗余信息。通过这种方式,可获得更全面的软件表示,并将其作为漏洞检测的基础。结果:我们在三种广泛使用的多语言数据集(即C语言的Reveal、C++的Devign和Java的Code_vulnerability_java)上全面评估了该方法:(1) 在漏洞检测性能方面,准确率在三个数据集上分别达到86.09%、84.58%和80.43%,F1分数分别为82.87%、84.62%和79.58%;(2) 与七种当前最佳基线方法相比,本方法在数据集上准确率提升2.38 %-3.01 %,F1分数提升2.32 %-8.47 %;(3) 此外,消融实验表明,结合二进制代码与源代码(相较于仅使用源代码)时,准确率提升6.83 %-13.76 %,F1分数提升5.36 %-9.86 %,证实了多模态数据融合带来的显著性能增益。结论:结果表明,本方法能够有效完成软件漏洞检测任务。同时,消融实验验证了二进制代码对检测的贡献,并表明了本融合策略的有效性。我们已公开代码与数据集(https://github.com/Wangqxn/Vul-detection)以促进后续研究。
Keyword:
Software vulnerability detection
Multimodal fusion
Source codes feature
Binary codes feature
期刊
S
IF:
1.4
论文数:
51
被引数:
1.6K
机构
引用论文
Transformer-based statement level vulnerability detection by cross-modal fine-grained features capture基于Transformer的语句级漏洞检测,通过跨模态细粒度特征捕获
Early and Realistic Exploitability Prediction of Just-Disclosed Software Vulnerabilities: How Reliable Can It Be?刚刚披露的软件漏洞的早期和现实的可利用预测: 它有多可靠?
Detecting Android malware: A multimodal fusion method with fine-grained featureAndroid恶意软件检测:一种细粒度特征的多模态融合方法
INFORMATION FUSION
IF15.5
Vul-LMGNNs: Fusing language models and online-distilled graph neural networks for code vulnerability detectionVul-lmgnns: 融合语言模型和在线蒸馏图神经网络进行代码漏洞检测
INFORMATION FUSION
IF15.5

