返回
Rethinking Reverse-Engineering-Based Backdoor Removal in Self-Supervised Learning
DOI:10.1109/tifs.2026.3723195.png)
摘要
En 中文
自监督学习(SSL)因其无需标签数据即可训练高性能模型的能力而备受关注,在交通标志识别等下游任务中取得了显著成果。然而,现有研究表明自监督学习易受后门攻击,导致潜在安全威胁。逆向工程可以重建植入的后门触发器,并通过抑制反向触发器的影响来移除后门。然而,现有的逆向工程方法要么专注于监督学习,要么只能反转低质量触发器,这些触发器足以被检测但不足以完全移除后门。本文对现有逆向工程方法进行了全面的理论分析,并观察到触发器增长现象。我们揭示了其背后的原理,基于此提出了一种专为自监督学习设计的新型后门移除方法,称为RECEIVE。RECEIVE引入了一种基于Wasserstein距离的原理性早停策略,在迭代触发器反转过程中识别最优反向触发器,实现了有效的后门遗忘同时保留了模型效用。在自监督学习中针对两种最先进的后门攻击的实验表明,RECEIVE仅需500张预训练数据(如低至0.5%)即可有效降低攻击成功率,超越了五种基线后门移除技术。
Keyword:
Backdoor defense
pre-trained encoders
mutual information
distillation
期刊
IF:
8
论文数:
5.3K
被引数:
2.3W
机构
引用论文
暂无论文信息

