arrow
返回

Malware detection using pre-trained transformer encoder with byte sequences

delete2025-10-13
delete0
PRE
AI
E
Eun‐Jin Kim
Y
Yun-Kyung Lee
S
Sang-Min Lee
A
Ah Reum Kang
M
M.-K. Kim
Y
Young-Seob Jeong *
DOI:10.1371/journal.pone.0332307delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
普通用户每天在网络中会遇到各种文档,如新闻文章、电子邮件和消息,其中大多数都容易受到恶意攻击。恶意攻击方法不断演变,使得基于神经网络的恶意软件检测方法在学术界和工业界越来越受欢迎。近期研究利用文件内的字节序列来检测恶意活动,主要使用卷积神经网络来捕捉字节序列中的局部模式。与此同时,在自然语言处理领域,基于Transformer的语言模型已在各种任务中展现出卓越性能,并被应用于其他领域,如图像分析和语音识别。在本文中,我们介绍了一种新颖的基于Transformer的语言模型用于恶意软件检测,该模型将字节序列作为输入进行处理。我们提出了两种新的预训练策略:真伪预测和相同序列预测。包括常规的预训练策略,如掩码语言建模和下一句预测,我们探索了这些方法的全部可能组合。通过收集现有的恶意软件检测字节序列,我们构建了一个包含三种文件类型(PDF、HWP和MS Office)的基准数据集用于预训练和微调。我们的实验结果表明,我们的语言模型在恶意软件检测任务中优于卷积神经网络,实现了约2.7%p的宏观F1分数提升,类似于11.1%p。我们相信,我们的语言模型将为恶意软件检测服务提供基础模型,并将扩展我们的研究,开发一个能够处理更长字节序列的更强大的基于编码器的模型。

期刊

PLoS One 封面图
PLoS One
IF:
2.6
论文数:
2.6W
被引数:
81.6W

机构

P
Pai Chai University
学者数:
337
论文数: 339
被引数: 218
C
chungbuk national university
学者数:
1.7K
论文数: 729
被引数: 0
学者 查看更多机构
引用论文

引用论文

Long Short-Term Memory长短期记忆
err1997-11-01
err0
PREAI
errSepp Hochreiter; Jürgen Schmidhuber
err分享
err收藏
Empirical study on character level neural network classifier for Chinese text
err2019-04-01
err0
PREAI
errTonglee Chung; Bin Xu; Yongbin Liu; Chunping Ouyang; Siliang Li; Lingyun Luo
err分享
err收藏
Enhanced multi-scenario running safety assessment of railway bridges based on graph neural networks with self-evolutionary capability
err2024-11-01
err11
PREAI
errZhang, Peng; Zhao, Han; Shao, Zhanjun; Xie, Xiaonan; Hu, Huifang; Zeng, Yingying; Jiang, Lizhong; Xiang, Ping
err分享
err收藏
Static Malware Detection Using Stacked BiLSTM and GPT-2基于堆叠BiLSTM和GPT-2的静态恶意软件检测
err2022-01-01
err26
errOAAI
errDemirci, Deniz; Sahin, Nazenin; Sirlancis, Melih; Acarturk, Cengiz
err分享
err收藏
err分享
err收藏
学者 查看更多内容