arrow
返回

Centralized Position Embeddings for Vision Transformers

delete2025-01-01
delete0
delete
OA
AI
C
Chanyong Shin
I
Ilwi Yun
H
Hyunku Lee
C
Chae Eun Rhee
DOI:10.1109/ACCESS.2025.3629376delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
Vision Transformers (ViTs)在各类视觉任务中取得了显著成功。然而,ViTs本身缺乏空间归纳偏置,需要显式的位置嵌入(PE)方案。最近,许多研究采用非固定长度位置嵌入(nFPEs)替代传统的绝对或相对PEs。这些nFPEs通常通过归纳模块(如卷积层)实现,具有适应不同标记序列长度和潜在平移等变性的优势。然而,我们的分析表明,常见的nFPE方法往往会产生被特征内容显著偏倚的位置信息,而这尚未被讨论。本文认为,现有工作中的nFPEs存在两个常见局限性。首先,nFPEs表现出显著的语义偏倚,因为它们易受输入特征图语义内容的影响并发生扭曲,导致位置信息模糊。其次,尽管内在的标记顺序在整个网络中保持不变,nFPEs仍在每个Transformer块中冗余地重新计算位置信息,导致效率低下并可能造成PE应用不一致。为克服这些缺点,我们提出中心化位置嵌入(CPE)。CPE的核心思想是用每个阶段的统一PE网络替代分散在每个Transformer块中的PE模块,其输出广播至该阶段的所有Transformer块。这种中心化设计使PE网络具有显著更大的感受野且计算开销可忽略,有助于提取更少偏倚、更一致的位置信息,从而解决nFPEs的上述局限性。通过将所提CPE应用于多种ViT及多个视觉任务,我们证明CPE能产生更精确的位置信息,相较现有PE策略带来一致的性能提升,支持我们的论点。
Keyword:
Computer vision
position embedding
vision transformer
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

IEEE Access 封面图
IEEE Access
IF:
3.6
论文数:
9.8W
被引数:
29.4W

机构

S
Seoul National University
学者数:
4.9K
论文数: 2.0K
被引数: 6.6W
H
hanyang university
学者数:
2.9W
论文数: 2.7W
被引数: 36
I
Inha University
学者数:
1.1W
论文数: 1.1W
被引数: 1.1W
学者 查看更多机构
引用论文

引用论文

暂无论文信息