返回
Lightweight Multimodal Adapter for Visual Object Tracking
DOI:10.3390/bdcc9110292.png)
摘要
En 中文
视觉目标跟踪是一项基础性的计算机视觉任务,近期已扩展至多模态场景,其中自然语言描述可补充视觉信息。现有的多模态跟踪器通常依赖大规模Transformer架构,联合训练视觉和文本编码器,导致产生数亿个可训练参数和巨大的计算开销。我们提出一种轻量级多模态适配器,可将文本描述集成到现有最先进的纯视觉框架中,且开销极小。预训练的视觉和文本编码器被冻结,仅训练一个小型投影网络以对齐文本嵌入与视觉特征。该适配器具有模块化特性,可在推理时切换,且对速度影响可忽略不计。大量实验表明,文本提示可提升跟踪的鲁棒性,并支持与重型多模态跟踪器相比少100倍以上可训练参数的高效多模态集成,允许在资源受限设备上进行训练和部署。
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。

