返回
Armor: Shielding Unlearnable Examples Against Data Augmentation
DOI:10.1109/TPAMI.2026.3652456.png)
摘要
En 中文
私有数据在线发布时,可能被未经授权的第三方收集用于训练深度神经网络(DNNs)。为保护隐私,可通过向原始样本添加防御性噪声,以降低其对DNNs的可学习性。近期,研究者提出了不可学习样本(Huang et al., 2021),旨在最小化训练损失,使模型几乎无法学习到任何信息。然而,原始数据在用于训练前通常需进行预处理,这可能恢复受保护数据中的私有信息。本文揭示了数据增强这一常用的数据预处理技术对模型泛化能力的提升所引发的隐私泄露问题,据我们所知,这是首次对此类问题进行研究。我们证明,数据增强可将基于不可学习样本训练的模型准确率从21.3%显著提升至66.1%。为解决此问题,我们提出了一种防御框架,命名为Armor,以防范数据增强可能引发的隐私泄露。为克服无法访问模型训练过程的问题,我们设计了一种非局部模块辅助的代理模型,以更准确地捕捉数据增强的影响。此外,我们设计了代理增强选择策略,通过最大化增强样本与非增强样本之间的分布对齐,为每个类别选择最优增强策略。我们还采用动态步长调整算法来增强防御噪声生成过程。我们在4个数据集和5种数据增强方法上进行了大量实验,以验证Armor的性能。与6种当前最先进的防御方法对比表明,Armor能够在数据增强条件下保持受保护私有数据的不可学习性。与基线相比,Armor将基于增强保护样本训练的模型测试准确率降低了高达60%。我们还证明Armor对对抗训练具有鲁棒性。论文发表后,我们将开源代码。
Keyword:
Unlearnable examples
data augmentation
and data privacy preservation
期刊
IF:
18.6
论文数:
864
被引数:
9.8W

