arrow
返回

Lightweight Structure-Aware Attention for Visual Understanding

delete2025-05-26
delete0
PRE
AI
H
Heeseung Kwon
F
Francisco M. Castro
M
Manuel J. Marín‐Jiménez
N
Nicolás Guil
K
Karteek Alahari *
DOI:10.1007/s11263-025-02475-7delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
注意力算子自提供可通过可调核实现的灵活性以来,已被广泛用作视觉理解的基本构建模块。然而,该算子存在固有局限性:(1) 注意力核判别性不足,导致冗余度高,(2) 计算和内存复杂度与序列长度呈二次方关系。在本文中,我们提出了一种新型注意力算子,称为轻量级结构感知注意力(LiSA),其具有更好的表示能力且复杂度为对数线性。我们的算子通过学习结构模式将注意力核转化为更具判别性的形式。这些结构模式通过利用一组相对位置嵌入(RPEs)作为乘法权重进行编码,从而提升注意力核的表示能力。此外,RPEs被近似处理以获得对数线性复杂度。我们的实验与分析表明,所提出的算子优于自注意力及其他现有算子,在ImageNet-1K和其他下游任务(如Kinetics-400上的视频动作识别、COCO上的目标检测与实例分割,以及ADE-20K上的语义分割)上达到了最佳结果。
Keyword:
Visual Understanding
Vision Transformer
Self-Attention
Image Recognition

期刊

International Journal of Computer Vision 封面图
International Journal of Computer Vision
IF:
9.3
论文数:
3.9K
被引数:
2.8W

机构

U
Univ Cordoba
学者数:
479
论文数: 197
被引数: 33
U
Univ Malaga
学者数:
462
论文数: 220
被引数: 41
引用论文

引用论文

Temporal Segment Networks: Towards Good Practices for Deep Action Recognition
err2016-09-17
err0
PREAI
errLimin Wang; Yuanjun Xiong; Zhe Wang; Yu Qiao; Dahua Lin; Xiaoou Tang; Luc Van Gool
err分享
err收藏
A ConvNet for the 2020s21世纪20年代的ConvNet
err2022-06-01
err0
PREAI
errZhuang Liu; Hanzi Mao; Chao-Yuan Wu; Christoph Feichtenhofer; Trevor Darrell; Saining Xie
err分享
err收藏
Scale-Aware Modulation Meet Transformer
err2023-10-01
err0
errOAAI
errWeifeng Lin; Ziheng Wu; Jiayu Chen; Jun Huang; Lianwen Jin
err分享
err收藏
err分享
err收藏
InternImage: Exploring Large-Scale Vision Foundation Models with Deformable ConvolutionsInternImage: 使用可变形卷积探索大型视觉基础模型
err2023-06-01
err0
errOAAI
errWenhai Wang; Jifeng Dai; Zhe Chen; Zhenhang Huang; Zhiqi Li; Xizhou Zhu; Xiaowei Hu; Tong Lu; Lewei Lu; Hongsheng Li; Xiaogang Wang; Yu Qiao
err分享
err收藏
End-to-End Object Detection with Transformers使用Transformers进行端到端对象检测
err2020-11-03
err0
PREAI
errNicolas Carion; Francisco Massa; Gabriel Synnaeve; Nicolas Usunier; Alexander Kirillov; Sergey Zagoruyko
err分享
err收藏
err分享
err收藏
学者 查看更多内容