arrow
返回

VideoAligner: Text-driven feature decomposition for precise video-text alignment

delete2026-09-29
delete0
PRE
AI
Z
Zhanzhou Feng
S
Shunan Mao
W
Wang, Yaowei
张史梁 封面图
张史梁 (Shiliang Zhang) *
DOI:10.1016/j.patcog.2026.113971delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
基于文本的视频检索中,文本查询通常传达用户期望检索的特定对象和事件,这些提示比视频内容更为简洁。视频内容与查询提示之间的信息密度差异导致了查询-视频对齐的困难。为了追求更紧凑的视频表示和准确的多模态特征匹配,本文提出了一种新颖的VideoAligner来解耦视频特征。VideoAligner首先从查询文本中生成“对象”和“事件”标记,随后检测并合并与查询概念相关的视觉标记。换句话说,我们使用“对象”和“事件”标记来表示查询提示,从而监督视频中有意义视觉特征的解耦与提取。VideoAligner最终产生紧凑的视觉标记,明确描述查询对象和事件。在三个广泛使用的数据集上的大量实验证明了我们方法的有前景的性能和领域泛化能力。例如,我们的方法在效率上表现更好,并在三个数据集上一致优于许多近期工作(如ProST)。我们希望为未来以特定模态为指导的协同跨模态学习工作提供启发。
Keyword:
Video signal processing
Visual information retrieval
Representation learning
Visualization

期刊

Pattern Recognition 封面图
Pattern Recognition
IF:
7.6
论文数:
1.3W
被引数:
4.5W

机构

P
peng cheng laboratory
学者数:
71
论文数: 47
被引数: 0
P
Peking University
学者数:
2.8K
论文数: 876
被引数: 0
引用论文

引用论文

暂无论文信息