返回
Dynamic multi-modal prompt generation for Visual-Language Tracking
DOI:10.1016/j.image.2026.117583.png)
摘要
En 中文
现有视觉-语言跟踪器通常依赖第一帧的静态模板和语言提示。然而,静态提示无法适应目标动态变化,导致语义偏差,从而降低跟踪器的鲁棒性。为解决此问题,我们提出了视觉-语言跟踪中的动态多模态提示生成(DMPGTrack)。首先,我们提出了一种目标感知的精细粒度提示生成器(TFTCG),利用预训练对比学习模型的强大跨模态对齐能力,将目标外观映射到预定义的颜色和对象类别的精细粒度词汇表上。通过这种方式,生成器无需手动标注即可产生精确且外观一致的目标词汇提示。随后,我们设计了一个多模态提示生成模块(MPGM),利用这些提示及目标的最新状态指导大语言模型(LLM)生成精细粒度语言提示。在此过程中,视觉特征从LLM的视觉-语言表示学习阶段提取,确保特征与提示高度相关,同时减少令牌使用。最后,语言和视觉提示组合成多模态提示,输入视觉-语言统一建模模块。此外,我们设计了一个实时语义一致性监控器(RSCM),用于检测实时跟踪过程中多模态提示与目标状态之间的语义偏差。当出现偏差时,它指导MPGM动态更新多模态提示,从而维持语义一致性。我们在多个语言辅助跟踪数据集(包括LaSOT、OTB99-LANG和TNL2K)上进行了大量实验,以证明所提跟踪器相较于现有视觉-语言跟踪器的优越性。
Keyword:
Object Tracking
Vision-Language Tracking
Multi-modal modeling
期刊
S
IF:
2.7
论文数:
132
被引数:
0
机构
引用论文
暂无论文信息

