arrow
返回

Rectifying Multi-Attack Adversarial Perturbations in Deep Neural Network based Image Classifier

delete2025-10-13
delete0
PRE
AI
Y
Yulong Wang
J
Jiaxuan Song
T
Tianxiang Li
X
Xin Yuan
H
Hong Li
N
Ni Wei
DOI:10.1145/3765757delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
图像分类的深度神经网络(DNNs)仍然容易受到对抗扰动的影响——这些微妙的输入操纵会导致灾难性的误分类。为解决这一问题,我们提出了对抗图像校正器(Adversarial Image Rectifier, AIR),这是一种受语言学启发的检测与缓解框架,通过在特征层面拦截和反转对抗扰动来增强DNN的鲁棒性。与现有防御方法不同,AIR无需预先了解攻击模式:它首先将DNN的层次化隐藏层特征图编码为具有语义结构的句子表示,然后通过这些句子中的“情感”异常来识别对抗输入——这是一种用于描述微妙对抗痕迹的语言学隐喻。关键在于,我们确定了对抗扰动主要传播的一个关键中间层,并训练了一个轻量级校正网络,在该层选择性消除对抗特征,同时保留良性语义。在Tiny-ImageNet、CIFAR-10、SVHN和MS COCO上的大量实验表明,AIR在防御已知攻击和未知攻击时,分别实现了高达95.02%和94.62%的校正率,显著超越了现有的防御技术。

期刊

A
ACM Transactions on Privacy and Security
IF:
2.8
论文数:
293
被引数:
770

机构

暂无机构信息
引用论文

引用论文

New Adversarial Image Detection Based on Sentiment Analysis
err2024-10-01
err4
errOAAI
errWang, Yulong; Li, Tianxiang; Li, Shenghong; Yuan, Xin; Ni, Wei
err分享
err收藏
err分享
err收藏
err分享
err收藏
err分享
err收藏
没有更多内容