返回
Diffusion-Based Adversarial Purification With Feature Distillation
DOI:10.1109/TBDATA.2025.3594243.png)
摘要
En 中文
对抗性净化是一种利用生成模型来中和对抗性扰动的防御策略。扩散模型因其强大的生成能力而脱颖而出,使其成为对抗性净化方法中生成模型的最新选择。保持对抗攻击的鲁棒性与图像内容完整性之间的平衡至关重要。然而,这些扩散模型通常仅针对干净数据进行训练。我们通过实验证明,在对抗性净化任务中,扩散模型所操作的数据分布常常受到对抗性扰动的污染。调整扩散长度以有效掩盖对抗性扰动同时保留图像标签语义被证明具有挑战性。在本文中,我们提出了一种创新的基于蒸馏的扩散方法用于对抗性净化,使扩散模型能够有效操作于被污染的数据分布。我们的方法涉及一个新颖的训练过程,通过将对抗样本整合到扩散模型的训练中,将对抗性扰动视为模型预测的扩散噪声的一部分。抵抗扰动关键在于使净化图像的特征表示与干净图像的特征表示更加一致。为此,我们开发了一种特征蒸馏技术,以赋予扩散模型从对抗样本中学习和提取干净特征表示的能力。广泛的实验表明,我们的方法在对抗各种自适应攻击基准方面达到了最先进的性能。
Keyword:
Adversarial purification
diffusion model
feature distillation
robustness
期刊
I
IF:
5.7
论文数:
881
被引数:
3.0K
机构
引用论文
暂无论文信息

