arrow
返回

Lightweight Multimodal Adapter for Visual Object Tracking

delete2025-11-18
delete0
delete
OA
AI
V
Vasyl Borsuk *
V
Vitaliy Yakovyna
N
Nataliya Shakhovska *
DOI:10.3390/bdcc9110292delete
delete原文链接
delete分享
delete收藏
查看原文
摘要

摘要

En 中文
视觉目标跟踪是一项基础性的计算机视觉任务,近期已扩展至多模态场景,其中自然语言描述可补充视觉信息。现有的多模态跟踪器通常依赖大规模Transformer架构,联合训练视觉和文本编码器,导致产生数亿个可训练参数和巨大的计算开销。我们提出一种轻量级多模态适配器,可将文本描述集成到现有最先进的纯视觉框架中,且开销极小。预训练的视觉和文本编码器被冻结,仅训练一个小型投影网络以对齐文本嵌入与视觉特征。该适配器具有模块化特性,可在推理时切换,且对速度影响可忽略不计。大量实验表明,文本提示可提升跟踪的鲁棒性,并支持与重型多模态跟踪器相比少100倍以上可训练参数的高效多模态集成,允许在资源受限设备上进行训练和部署。
AI总结

AI总结

对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

期刊

B
Big Data and Cognitive Computing
IF:
4.4
论文数:
1.3K
被引数:
2.4K

机构

L
Lviv Polytechnic National University
学者数:
934
论文数: 683
被引数: 476