返回
Adversarial guided diffusion models for adversarial purification
DOI:10.1016/j.neunet.2025.107705.png)
摘要
En 中文
基于扩散模型(DM)的对抗性净化(AP)已被证明是一种强大的防御方法,能够移除对抗性扰动并生成无威胁的净化样本。在原理上,预训练的DM只能确保净化样本符合训练数据的相同分布,但可能会无意中损害输入样本的语义信息,导致净化样本被误分类。近期进展引入了引导扩散技术,以在移除扰动的同时保留语义信息。然而,这些引导方法通常依赖于净化样本与扩散样本之间的距离度量,这可能导致净化样本中保留扰动。为了进一步释放基于DM的AP的鲁棒性潜力,我们提出了一种对抗性引导扩散模型,通过引入一种包含充足语义信息但未显式涉及对抗性扰动的对抗性引导。该引导由通过对抗训练获得的辅助神经网络建模,考虑的是潜在表示中的距离而非像素级值。在CIFAR-10、CIFAR-100和ImageNet上进行了大量实验,以证明我们的方法在同时保留语义信息和移除对抗性扰动方面是有效的。此外,综合比较表明,我们的方法显著增强了现有基于DM的AP的鲁棒性,在CIFAR-10上的平均鲁棒准确率最高提升了7.30%。
期刊
IF:
6.3
论文数:
7.8K
被引数:
3.0W
机构
暂无机构信息

