arrow
返回

AdaPT: Adaptive position trigger for improving backdoor attacks in transfer learning

delete2026-09-29
delete0
PRE
AI
Z
Zhou, Chun
H
Hua Meng
Z
Zhiguo Long
Z
Zhang, Mingxing
Z
Zhengchun Zhou *
DOI:10.1016/j.patcog.2026.114247delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
神经网络中的后门攻击已演变为AI安全的关键威胁,并吸引了广泛的研究关注。大多数现有攻击在端到端学习框架下运行,在测试集上实现接近100%的攻击成功率,同时在特定数据集上污染少于10%的训练样本。然而,随着公共数据集的积累和预训练模型的广泛采用,实际应用中通常采用迁移学习,即预训练模型首先提取特征后再训练分类头。我们的研究表明,该框架显著降低了传统端到端后门攻击的有效性。本文从隐藏特征差异的角度分析了这一失效机制。基于此见解,我们提出了AdaPT,一种自适应位置触发器攻击,通过最大化此类差异来自动搜索最优触发器插入位置。大量实验表明,AdaPT在冻结骨干网络的迁移学习中将攻击成功率平均相对提升了60%,将后门学习平均减少400次训练迭代,并表现出对Neural Cleanse、Fine-pruning和基于Grad-CAM的分析等代表性防御的实证鲁棒性。这些结果表明,基于公共数据集和预训练特征提取器构建的迁移学习系统可能仍然容易受到精心定位的触发器攻击,突显了为实际预训练模型部署场景设计专门防御的必要性。
Keyword:
AI security
Backdoor attack
Backdoor defense
Transfer learning

期刊

Pattern Recognition 封面图
Pattern Recognition
IF:
7.6
论文数:
1.3W
被引数:
4.5W

机构

S
Southwest Jiaotong University
学者数:
2.2K
论文数: 604
被引数: 0
引用论文

引用论文

暂无论文信息