返回
Centralized Position Embeddings for Vision Transformers
DOI:10.1109/ACCESS.2025.3629376.png)
摘要
En 中文
Vision Transformers (ViTs)在各类视觉任务中取得了显著成功。然而,ViTs本身缺乏空间归纳偏置,需要显式的位置嵌入(PE)方案。最近,许多研究采用非固定长度位置嵌入(nFPEs)替代传统的绝对或相对PEs。这些nFPEs通常通过归纳模块(如卷积层)实现,具有适应不同标记序列长度和潜在平移等变性的优势。然而,我们的分析表明,常见的nFPE方法往往会产生被特征内容显著偏倚的位置信息,而这尚未被讨论。本文认为,现有工作中的nFPEs存在两个常见局限性。首先,nFPEs表现出显著的语义偏倚,因为它们易受输入特征图语义内容的影响并发生扭曲,导致位置信息模糊。其次,尽管内在的标记顺序在整个网络中保持不变,nFPEs仍在每个Transformer块中冗余地重新计算位置信息,导致效率低下并可能造成PE应用不一致。为克服这些缺点,我们提出中心化位置嵌入(CPE)。CPE的核心思想是用每个阶段的统一PE网络替代分散在每个Transformer块中的PE模块,其输出广播至该阶段的所有Transformer块。这种中心化设计使PE网络具有显著更大的感受野且计算开销可忽略,有助于提取更少偏倚、更一致的位置信息,从而解决nFPEs的上述局限性。通过将所提CPE应用于多种ViT及多个视觉任务,我们证明CPE能产生更精确的位置信息,相较现有PE策略带来一致的性能提升,支持我们的论点。
Keyword:
Computer vision
position embedding
vision transformer
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
3.6
论文数:
9.8W
被引数:
29.4W
机构
引用论文
暂无论文信息

