返回
Stealthy Query-Efficient OpaqueAttack Against Interpretable Deep Learning
DOI:10.1109/TR.2025.3551717.png)
摘要
En 中文
深度神经网络(DNN)模型在白盒和黑盒环境中易受对抗样本攻击。尽管先前研究已显示高攻击成功率,但将DNN模型与解释模型耦合可在人类专家参与时提供一定安全保障。然而,在白盒环境中,可解释深度学习系统(IDLSes)已被证明易受恶意操纵。由于在黑盒场景中IDLS组件的访问受限,攻击者欺骗系统变得更加困难。在本工作中,我们提出了一种针对IDLSes的查询高效基于分数的黑盒攻击方法(Query-efficient Score-based opaque attack),该方法无需了解目标模型及其耦合的解释模型。通过根据IDLS的反馈分数持续优化生成的对抗样本,我们的方法有效减少了模型查询次数,并在搜索空间中导航以识别可欺骗系统的扰动。我们在四个卷积神经网络(CNN)模型和两种解释模型上评估了该攻击的有效性,使用了ImageNet和CIFAR数据集。结果表明,所提方法查询高效,攻击成功率可达95%以上,平均迁移成功率为69%。我们还证明了该攻击能够抵御各种预处理防御技术。
Keyword:
Adversarial learning
opaque attack
deep learning
interpretability
transferability
期刊
IF:
5.7
论文数:
2.7K
被引数:
8.5K

