arrow
返回

Memory optimization network for enhanced vision-language target tracking

delete2026-03-04
delete0
PRE
AI
J
Jianwei Zhang
W
Wendi Zhang
H
Huanlong Zhang
S
Shoukang Yi
B
Bin Jiang
Z
Zhoujingzi Qiu *
DOI:10.1007/s11227-026-08377-wdelete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
在视频-语言跟踪中,提供全面且精确的历史信息对于处理涉及目标外观变化的场景至关重要。然而,现有方法所利用的历史信息包含大量噪声,并且通常需要重复训练。这导致历史参考不精确,并引入显著的计算量,从而降低了准确性并增加了模型复杂度。为解决此问题,我们提出了增强视觉-语言目标跟踪的记忆优化网络(VLMOTrack)。具体而言,我们设计了一种两阶段标记过滤机制(TTFM)。它采用分层注意力来调整目标权重,以实现渐进式筛选。第一阶段利用稳定的初始模板特征对背景信息进行粗粒度过滤。第二阶段通过利用稳定的语言和丰富的历史视觉提示,精细地消除非目标标记。因此,模型能够获得精确的目标特征表示。此外,我们构建了一种自适应记忆提示生成机制(AMPGM)。它采用基于卷积的选择策略来识别可靠帧,这些帧通过轻量级编码器和卷积块编码为键值对结构,并存储在记忆库中。后续帧自适应地聚合值,从而生成精确且定制化的记忆提示。最后,我们提出了一种记忆提示传播策略。记忆提示通过卷积块与搜索特征融合,以增强时序一致性和可区分性。随后,它按照TTFM的描述进行操作,将历史提示传播到后续帧,用于预测和推理。我们在TNL2K、LaSOT、OTB99-Lang和LaSOText数据集上进行了实验。实验结果表明,VLMOTrack具有良好的竞争力。
Keyword:
Object tracking
Vision-language
Memory network
Prompt learning

期刊

T
The Journal of Supercomputing
IF:
0
论文数:
647
被引数:
0

机构

E
electrical and information engineering
学者数:
108
论文数: 39
被引数: 0
C
computer science and technology
学者数:
435
论文数: 173
被引数: 0
S
software engineering
学者数:
58
论文数: 37
被引数: 0
S
Shenzhen Institute for Advanced Study
学者数:
48
论文数: 21
被引数: 0
学者 查看更多机构
引用论文

引用论文

err分享
err收藏
Autoregressive Visual Tracking
err2023-06-01
err0
PREAI
errXing Wei; Yifan Bai; Yongchao Zheng; Dahu Shi; Yihong Gong
err分享
err收藏
Tracking by Natural Language Specification
err2017-07-01
err0
errOAAI
errZhenyang Li; Ran Tao; Efstratios Gavves; Cees G. M. Snoek; Arnold W. M. Smeulders
err分享
err收藏
CBAM: Convolutional Block Attention ModuleCBAM: 卷积块注意力模块
err2018-10-06
err0
PREAI
errSanghyun Woo; Jongchan Park; Joon-Young Lee; In So Kweon
err分享
err收藏
err分享
err收藏
学者 查看更多内容