返回
PATCHOUT: Adversarial Patch Detection and Localization using Semantic Consistency
DOI:10.1007/s11063-025-11775-5.png)
摘要
En 中文
计算机视觉系统正积极部署在自动驾驶车辆等安全关键型应用中。现实世界中的对抗性贴图能够破坏人工智能(AI)系统并导致灾难性后果。现有针对贴图攻击的防御方法基于识别高强度的神经元、特征或梯度。然而,这些防御方法容易受到攻击特征不明显、强度较弱的攻击的威胁。本文提出了PATCHOUT框架,该框架通过语义一致性检测并定位对抗性贴图。在贴图检测方面,关键洞见在于:对于良性图像,实体的顶级类别预测在语义上是一致的,而对于受攻击图像则不一致。在贴图定位方面,观察到贴图与图像的粗粒度分割在语义上是一致的。这使得PATCHOUT框架能够结合类别一致性检查器以及图像分割、归因分析和图像修复技术来检测并移除对抗性贴图。实验评估表明,PATCHOUT能够以超过90%的准确率检测到广泛的对抗性贴图,其准确率比其他防御方法高出20%。该框架还针对未见攻击和自适应攻击进行了评估,将自适应攻击的成功率从56%降低至24%。
Keyword:
Adversarial Machine Learning
Adversarial Patch
Computer Vision
Artificial Intelligence
期刊
IF:
2.8
论文数:
174
被引数:
5.5K

