返回
Lightweight Structure-Aware Attention for Visual Understanding
DOI:10.1007/s11263-025-02475-7.png)
摘要
En 中文
注意力算子自提供可通过可调核实现的灵活性以来,已被广泛用作视觉理解的基本构建模块。然而,该算子存在固有局限性:(1) 注意力核判别性不足,导致冗余度高,(2) 计算和内存复杂度与序列长度呈二次方关系。在本文中,我们提出了一种新型注意力算子,称为轻量级结构感知注意力(LiSA),其具有更好的表示能力且复杂度为对数线性。我们的算子通过学习结构模式将注意力核转化为更具判别性的形式。这些结构模式通过利用一组相对位置嵌入(RPEs)作为乘法权重进行编码,从而提升注意力核的表示能力。此外,RPEs被近似处理以获得对数线性复杂度。我们的实验与分析表明,所提出的算子优于自注意力及其他现有算子,在ImageNet-1K和其他下游任务(如Kinetics-400上的视频动作识别、COCO上的目标检测与实例分割,以及ADE-20K上的语义分割)上达到了最佳结果。
Keyword:
Visual Understanding
Vision Transformer
Self-Attention
Image Recognition
期刊
IF:
9.3
论文数:
3.9K
被引数:
2.8W
机构
引用论文
InternImage: Exploring Large-Scale Vision Foundation Models with Deformable ConvolutionsInternImage: 使用可变形卷积探索大型视觉基础模型

