返回
VideoAligner: Text-driven feature decomposition for precise video-text alignment
DOI:10.1016/j.patcog.2026.113971.png)
摘要
En 中文
基于文本的视频检索中,文本查询通常传达用户期望检索的特定对象和事件,这些提示比视频内容更为简洁。视频内容与查询提示之间的信息密度差异导致了查询-视频对齐的困难。为了追求更紧凑的视频表示和准确的多模态特征匹配,本文提出了一种新颖的VideoAligner来解耦视频特征。VideoAligner首先从查询文本中生成“对象”和“事件”标记,随后检测并合并与查询概念相关的视觉标记。换句话说,我们使用“对象”和“事件”标记来表示查询提示,从而监督视频中有意义视觉特征的解耦与提取。VideoAligner最终产生紧凑的视觉标记,明确描述查询对象和事件。在三个广泛使用的数据集上的大量实验证明了我们方法的有前景的性能和领域泛化能力。例如,我们的方法在效率上表现更好,并在三个数据集上一致优于许多近期工作(如ProST)。我们希望为未来以特定模态为指导的协同跨模态学习工作提供启发。
Keyword:
Video signal processing
Visual information retrieval
Representation learning
Visualization

