arrow
返回

Complementary Text-Guided Attention for Zero-Shot Adversarial Robustness

delete2026-03-02
delete0
PRE
AI
余璐 封面图
余璐 (Lu Yu)
H
Haiyang Zhang
徐常胜 (Changsheng Xu)
DOI:10.1109/TPAMI.2026.3669252delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
由于出色的零样本能力,预训练的视觉-语言模型(如CLIP)已在各个领域引起广泛关注和应用。然而,CLIP已被观察到易受对抗样本攻击。通过实验分析,我们发现对抗扰动会引发文本引导注意力的偏移。基于此观察,我们提出了一种简单而有效的策略:文本引导注意力用于零样本鲁棒性(TGA-ZSR)。该框架包含两个组件:局部注意力精调模块和全局注意力约束模块。我们的目标是保持CLIP模型的泛化能力并增强其对抗鲁棒性:局部注意力精调模块将目标模型通过对抗样本获得的文本引导注意力与原始模型通过干净样本获得的文本引导注意力对齐,这种对齐增强了模型的鲁棒性。此外,全局注意力约束模块使用干净样本从目标模型和原始模型获取文本引导注意力,其目的是在保持干净样本性能的同时提升整体鲁棒性。然而,我们发现该方法偶尔会关注无关或冗余特征,这可能导致次优性能并在某些场景下削弱其鲁棒性。为克服此局限,我们进一步提出了互补文本引导注意力(Comp-TGA)方法。该方法整合了两类前景注意力:由类别提示引导的注意力和由非类别提示驱动的反向注意力。这些互补的注意力机制使模型能捕获更全面且准确的前景表示。实验验证,TGA-ZSR和Comp-TGA分别在16个数据集上使零样本鲁棒准确率较当前最优技术提升了9.58%和11.95%。
Keyword:
Zero-shot adversarial robustness
vision-language models

期刊

IEEE Transactions on Pattern Analysis and Machine Intelligence 封面图
IEEE Transactions on Pattern Analysis and Machine Intelligence
IF:
18.6
论文数:
864
被引数:
9.8W

机构

T
tianjin university of technology
学者数:
2.0K
论文数: 607
被引数: 0
C
chinese academy of sciences
学者数:
56.7W
论文数: 45.0W
被引数: 704
引用论文

引用论文

暂无论文信息