arrow
返回

Rethinking Reverse-Engineering-Based Backdoor Removal in Self-Supervised Learning

delete2026-08-12
delete0
PRE
AI
T
Tingxu Han
W
Weisong Sun
Y
Yifei Ge
房
房春荣 (Chunrong Fang)
Z
Z.G. Wang
S
Shiqing Ma
陈
陈振宇 (Zhenyu Chen)
X
Xiangyu Zhang
DOI:10.1109/tifs.2026.3723195delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
自监督学习(SSL)因其无需标签数据即可训练高性能模型的能力而备受关注,在交通标志识别等下游任务中取得了显著成果。然而,现有研究表明自监督学习易受后门攻击,导致潜在安全威胁。逆向工程可以重建植入的后门触发器,并通过抑制反向触发器的影响来移除后门。然而,现有的逆向工程方法要么专注于监督学习,要么只能反转低质量触发器,这些触发器足以被检测但不足以完全移除后门。本文对现有逆向工程方法进行了全面的理论分析,并观察到触发器增长现象。我们揭示了其背后的原理,基于此提出了一种专为自监督学习设计的新型后门移除方法,称为RECEIVE。RECEIVE引入了一种基于Wasserstein距离的原理性早停策略,在迭代触发器反转过程中识别最优反向触发器,实现了有效的后门遗忘同时保留了模型效用。在自监督学习中针对两种最先进的后门攻击的实验表明,RECEIVE仅需500张预训练数据(如低至0.5%)即可有效降低攻击成功率,超越了五种基线后门移除技术。
Keyword:
Backdoor defense
pre-trained encoders
mutual information
distillation

期刊

IEEE Transactions on Information Forensics and Security 封面图
IEEE Transactions on Information Forensics and Security
IF:
8
论文数:
5.3K
被引数:
2.3W

机构

N
nanyang technological university
学者数:
781
论文数: 388
被引数: 0
R
Rutgers University
学者数:
107
论文数: 60
被引数: 0
U
University of Massachusetts Amherst
学者数:
124
论文数: 95
被引数: 0
P
Purdue University
学者数:
561
论文数: 238
被引数: 0
N
Nanjing University
学者数:
2.1K
论文数: 620
被引数: 0
学者 查看更多机构
引用论文

引用论文

暂无论文信息