返回
Towards Patch-Based Noise Compression for Adversarial Attack Against Transformer-Based Visual Tracking
DOI:10.1109/TIFS.2025.3648551.png)
摘要
En 中文
近年来,随着Vision Transformer (ViT)在视觉跟踪器中的广泛应用,其鲁棒性日益受到关注。然而,ViT通过关注图像块之间的全局交互,降低了其对局部噪声的敏感性,给对抗性攻击带来了新的挑战。与此同时,现有的基于决策的对抗性攻击方法往往忽略了不同块之间噪声敏感度的差异,进一步限制了对抗性噪声的压缩效率,尤其是在ViT中。在视觉跟踪领域,现有的对抗性攻击方法主要针对基于孪生网络的跟踪器,而对基于Transformer的跟踪器的对抗性攻击研究,尤其是基于决策的黑盒攻击,仍相对有限。为对基于Transformer的跟踪器实施有效的黑盒攻击,本文创新性地提出了基于块的对抗噪声压缩(PANC)方法,这是一种基于决策的对抗性攻击方法。该方法能够逐块有效地压缩对抗噪声,显著提高了压缩效率和攻击隐蔽性。PANC还引入了一个噪声敏感度矩阵,通过动态增减对抗噪声,优化噪声的空间分布并减少查询次数。我们在包括OSTrack、STARK、TransT和MixformerV2在内的多个基于Transformer的跟踪器以及GOT-10k、TrackingNet和LaSOT三个公开的大规模基准数据集上验证了所提PANC攻击方法的有效性。实验结果表明,与现有的最先进的对抗性攻击方法IoU攻击相比,PANC将噪声水平压缩至10%,在查询次数仅为45.7%的情况下,攻击有效性提升了162%。此外,PANC可作为其他对抗性攻击方法的初始化或后处理优化策略,为对抗样本生成提供更灵活高效的机制。我们的工作揭示了现有基于Transformer的视觉跟踪器的脆弱性,并为进一步提升对抗性攻击的效率和隐蔽性提供了新思路。
Keyword:
Adversarial attack
black-box attack
visual tracking
vision transformer
noise compression
期刊
IF:
8
论文数:
5.2K
被引数:
2.3W

