返回
Memory optimization network for enhanced vision-language target tracking
DOI:10.1007/s11227-026-08377-w.png)
摘要
En 中文
在视频-语言跟踪中,提供全面且精确的历史信息对于处理涉及目标外观变化的场景至关重要。然而,现有方法所利用的历史信息包含大量噪声,并且通常需要重复训练。这导致历史参考不精确,并引入显著的计算量,从而降低了准确性并增加了模型复杂度。为解决此问题,我们提出了增强视觉-语言目标跟踪的记忆优化网络(VLMOTrack)。具体而言,我们设计了一种两阶段标记过滤机制(TTFM)。它采用分层注意力来调整目标权重,以实现渐进式筛选。第一阶段利用稳定的初始模板特征对背景信息进行粗粒度过滤。第二阶段通过利用稳定的语言和丰富的历史视觉提示,精细地消除非目标标记。因此,模型能够获得精确的目标特征表示。此外,我们构建了一种自适应记忆提示生成机制(AMPGM)。它采用基于卷积的选择策略来识别可靠帧,这些帧通过轻量级编码器和卷积块编码为键值对结构,并存储在记忆库中。后续帧自适应地聚合值,从而生成精确且定制化的记忆提示。最后,我们提出了一种记忆提示传播策略。记忆提示通过卷积块与搜索特征融合,以增强时序一致性和可区分性。随后,它按照TTFM的描述进行操作,将历史提示传播到后续帧,用于预测和推理。我们在TNL2K、LaSOT、OTB99-Lang和LaSOText数据集上进行了实验。实验结果表明,VLMOTrack具有良好的竞争力。
Keyword:
Object tracking
Vision-language
Memory network
Prompt learning
期刊
T
IF:
0
论文数:
647
被引数:
0
机构
引用论文
Transformer vision-language tracking via proxy token guided cross-modal fusionTransformer vision-通过代理令牌引导的跨模态融合进行语言跟踪
Target–distractor memory joint tracking algorithm via Credit Allocation Network基于信用分配网络的目标-干扰物记忆联合跟踪算法

