返回
Semantic and Precise Trigger Inversion: Detecting Backdoored Language Models
DOI:10.1109/TIFS.2025.3594037.png)
摘要
En 中文
后门攻击对自然语言处理(NLP)模型构成了严重的安全威胁,允许攻击者通过隐藏的触发器操纵模型输出。尽管已开发出后门检测方法以解决此问题,但现有基于触发器反转的方法仅对简单、可见的触发器有效。这些方法难以处理语义增强的、不可见的触发器,并且由于依赖不可靠的启发式方法,往往无法提供准确的后门判定,从而难以可靠地区分被植入后门的模型与良性模型。这凸显了当前检测技术的关键空白。为应对这些挑战,我们提出了一种新颖的触发器反转方法 SemInv,其包含两个关键贡献:一致的语义反转和可识别条件检查。一致的语义反转在触发器优化过程中引入了一种新的正则化技术,能够更有效地反转语义受限的触发器。可识别条件检查评估不同可识别条件下的攻击性能裕度,为区分被植入后门的模型与良性模型提供稳健的证据。我们使用 TrojAI round 6–8 数据集对 SemInv 进行评估,并证明其在后门检测准确性和触发器反转性能方面均显著优于当前最先进的方法。我们的方法在对抗具有隐蔽触发器的模型时也证明有效,通过提供更全面的解决方案来识别后门攻击,从而推动了NLP安全领域的发展。代码仓库位于 https://github.com/Bluedask/SemInv。
Keyword:
Trigger inversion
backdoor detection
natural language processing
期刊
IF:
8
论文数:
5.3K
被引数:
2.3W
机构
引用论文
MobileBERT: a Compact Task-Agnostic BERT for Resource-Limited DevicesMobileBERT: 用于资源有限设备的紧凑任务不可知的BERT

