返回
Self-Adaptive Vision-Language Tracking With Context Prompting
DOI:10.1109/TIP.2025.3635016.png)
摘要
En 中文
由于视觉和语言模态之间存在显著差异,以及固定语言描述与动态视觉信息之间的不匹配问题,现有的视觉-语言跟踪方法性能与纯视觉跟踪相当或略差。有效利用语言的丰富语义来增强跟踪鲁棒性仍是一个开放性挑战。为解决这些问题,我们提出了一种自适应的视觉-语言跟踪框架,利用预训练的多模态CLIP模型获取对齐良好的视觉-语言表示。引入了一种新颖的上下文感知提示机制,可根据跟踪过程中不断演变的视觉上下文动态调整语言提示。具体而言,我们的上下文提示器从当前搜索图像中提取动态视觉特征,并将其整合到文本编码过程中,实现语言嵌入的自更新。此外,我们的框架采用统一的单流Transformer架构,支持纯视觉和视觉-语言跟踪场景的联合训练。我们的方法不仅弥合了模态差异,还通过允许语言特征随视觉上下文演变来增强鲁棒性。在四个视觉-语言跟踪基准上的大量实验表明,我们的方法有效利用语言优势增强了视觉跟踪性能。我们的大型模型在LaSOT$\text {LaSOT}_{\text {EXT}}$上获得55.0% AUC,在TNL2K上获得69.0% AUC。此外,我们的纯语言跟踪模型在TNL2K上实现了与最先进的纯视觉跟踪方法相当的性能。代码可在https://github.com/zj5559/SAVLT获取。
Keyword:
Vision-language tracking
context prompting
modality alignment
self-adaptation
期刊
IF:
13.7
论文数:
1.0W
被引数:
8.4W

