返回
Rectifying Multi-Attack Adversarial Perturbations in Deep Neural Network based Image Classifier
DOI:10.1145/3765757.png)
摘要
En 中文
图像分类的深度神经网络(DNNs)仍然容易受到对抗扰动的影响——这些微妙的输入操纵会导致灾难性的误分类。为解决这一问题,我们提出了对抗图像校正器(Adversarial Image Rectifier, AIR),这是一种受语言学启发的检测与缓解框架,通过在特征层面拦截和反转对抗扰动来增强DNN的鲁棒性。与现有防御方法不同,AIR无需预先了解攻击模式:它首先将DNN的层次化隐藏层特征图编码为具有语义结构的句子表示,然后通过这些句子中的“情感”异常来识别对抗输入——这是一种用于描述微妙对抗痕迹的语言学隐喻。关键在于,我们确定了对抗扰动主要传播的一个关键中间层,并训练了一个轻量级校正网络,在该层选择性消除对抗特征,同时保留良性语义。在Tiny-ImageNet、CIFAR-10、SVHN和MS COCO上的大量实验表明,AIR在防御已知攻击和未知攻击时,分别实现了高达95.02%和94.62%的校正率,显著超越了现有的防御技术。
期刊
A
IF:
2.8
论文数:
293
被引数:
770
机构
暂无机构信息
引用论文
Adversarial Learning Targeting Deep Neural Network Classification: A Comprehensive Review of Defenses Against Attacks
PROCEEDINGS OF THE IEEE
IF25.9
没有更多内容

