返回
Learning Language Prompt for Vision-Language Tracking
DOI:10.1109/TCSVT.2025.3557053.png)
摘要
En 中文
视觉语言目标跟踪整合了先进的语言信息,增强了其在复杂场景中的鲁棒性和准确性。然而,当前方法受限于缺乏充足的视觉语言数据,导致模型难以学习泛化知识。为缓解此问题,我们提出了一种新的基于提示的视觉语言跟踪框架,命名为ProVLT。该框架将语言信息视为预训练视觉跟踪模型的提示,从而利用大量跟踪数据中的知识。实验表明,ProVLT在仅训练少量参数(约为模态参数的29%)的情况下实现了有竞争力的性能。例如,ProVLT在TNL2K基准上达到了59.8%的AUC。此外,我们为五个主流纯视觉跟踪基准添加了语言注释,并发现语言信息的加入始终提升了跟踪性能。在这些基准上,语言信息使跟踪性能相比纯视觉跟踪器平均提升了2.9%。我们将向社区发布代码、模型和基准。
Keyword:
Vision-language tracking
prompt learning
language annotation
期刊
IF:
11.1
论文数:
846
被引数:
3.1W
机构
引用论文
Transformer vision-language tracking via proxy token guided cross-modal fusionTransformer vision-通过代理令牌引导的跨模态融合进行语言跟踪

