arrow
返回

Semantic and Precise Trigger Inversion: Detecting Backdoored Language Models

delete2025-01-01
delete0
PRE
AI
C
Chunlong Xie
J
Jialing He
Y
Ying Yang
S
Shangwei Guo
T
Tianwei Zhang
向
向涛 (Tao Xiang)
DOI:10.1109/TIFS.2025.3594037delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
后门攻击对自然语言处理(NLP)模型构成了严重的安全威胁,允许攻击者通过隐藏的触发器操纵模型输出。尽管已开发出后门检测方法以解决此问题,但现有基于触发器反转的方法仅对简单、可见的触发器有效。这些方法难以处理语义增强的、不可见的触发器,并且由于依赖不可靠的启发式方法,往往无法提供准确的后门判定,从而难以可靠地区分被植入后门的模型与良性模型。这凸显了当前检测技术的关键空白。为应对这些挑战,我们提出了一种新颖的触发器反转方法 SemInv,其包含两个关键贡献:一致的语义反转和可识别条件检查。一致的语义反转在触发器优化过程中引入了一种新的正则化技术,能够更有效地反转语义受限的触发器。可识别条件检查评估不同可识别条件下的攻击性能裕度,为区分被植入后门的模型与良性模型提供稳健的证据。我们使用 TrojAI round 6–8 数据集对 SemInv 进行评估,并证明其在后门检测准确性和触发器反转性能方面均显著优于当前最先进的方法。我们的方法在对抗具有隐蔽触发器的模型时也证明有效,通过提供更全面的解决方案来识别后门攻击,从而推动了NLP安全领域的发展。代码仓库位于 https://github.com/Bluedask/SemInv。
Keyword:
Trigger inversion
backdoor detection
natural language processing

期刊

IEEE Transactions on Information Forensics and Security 封面图
IEEE Transactions on Information Forensics and Security
IF:
8
论文数:
5.3K
被引数:
2.3W

机构

C
Chongqing University
学者数:
5.1W
论文数: 4.1W
被引数: 6.0W
N
Nanyang Technological University
学者数:
4.9W
论文数: 4.8W
被引数: 8.1W
学者 查看更多机构
引用论文

引用论文

Trojaning Attack on Neural Networks对神经网络的木马攻击
err2018-01-01
err0
errOAAI
errYingqi Liu; Shiqing Ma; Yousra Aafer; Wen-Chuan Lee; Juan Zhai; Weihang Wang; Xiangyu Zhang
err分享
err收藏
err分享
err收藏
err
IF0
err
err0
PREAI
err
err分享
err收藏
err
IF0
err
err0
errOAAI
err
err分享
err收藏
OntoNotes
err2006-01-01
err0
errOAAI
errEduard Hovy; Mitchell Marcus; Martha Palmer; Lance Ramshaw; Ralph Weischedel
err分享
err收藏
学者 查看更多内容