返回
Siamese Visual Tracking With Multi-Parallel Interactive Transformers
DOI:10.1109/TCSVT.2025.3569633.png)
摘要
En 中文
近年来,基于Siamese网络的视觉跟踪方法在效率和精度方面获得了广泛的关注和成功。然而,典型的Siamese跟踪器采用两个独立的权重共享流来描述样本和搜索区域,两者之间没有任何交互。因此,这类跟踪器仅使用浅层的互相关或相关滤波器来获取最终的信息关联,这忽略了样本和搜索区域之间的深层交互,可能降低跟踪器的判别能力。为了解决这一问题,我们提出了一种新颖的多并行交互Transformer-based(MPIT)跟踪框架,以引入充分的交互,使两个流能够更轻松地引导预测头聚焦于目标。与近期直接将模板和搜索token拼接以执行联合特征学习的单流Transformer-based跟踪器不同,我们的多并行交互框架引入了传输带模块,以低成本的计算代价为样本和搜索区域传递全局信息。此外,为了整合动态信息,我们将时序级提取整合到跟踪框架中,以增加模板的多样性。实验结果表明,所提出的MPIT方法在达到136帧每秒(FPS)的显著跟踪速度的同时,其性能优于或相当于当前最优的跟踪器。
Keyword:
Visual tracking
interaction information
multi-parallel transformers
Siamese networks
期刊
IF:
11.1
论文数:
845
被引数:
3.1W
机构
引用论文
暂无论文信息

