arrow
返回

PHA-Net: Prototype-based hierarchical alignment network for text-video retrieval

delete2026-08-01
delete0
PRE
AI
J
Jing, Xiaolun
Y
Yin, Kezhao
X
Xinxing Yang *
G
Genke Yang *
J
Jian Chu
DOI:10.1016/j.neucom.2026.134693delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
随着大规模图文预训练模型(如CLIP)的出现,近年来文本视频检索领域取得了显著进展。现有最佳方法涉及同时进行个体、局部和全局层面的跨模态语义对齐,引发了关于简洁文本与丰富视频之间固有语义不匹配的担忧。一种典范方法是整合多个图文注意力模块到层次框架中,尽管这种范式仅优化视觉表示且计算成本高昂。本文提出了一种新的基于原型的层次对齐网络(PHA-Net),用于跨模态对齐个体/局部/全局层面的表示。具体而言,我们引入多个模态共享原型作为桥梁,高效优化文本和视频表示以进行跨模态对齐。然后,我们指出聚类标记中不平衡的语义分布可能削弱检索性能,因为弱语义标记缺乏关注价值。为减少这些标记的影响,我们提出了原型支持标记合并模块,通过原型语义引导增强强语义标记并抑制弱语义标记。此外,我们设计了原型对比损失,鼓励文本和视觉原型关注不同的语义信息。该辅助损失旨在确保同一原型下的文本和视觉原型具有更高相似度,而非不同原型下的原型。在四个基准数据集上的广泛实验验证了PHA-Net的有效性,其在MSR-VTT(8.8%)、ActivityNet(19.2%)、VATEX(0.7%)和Charades(4.9%)的所有召回率总和上均实现了显著提升。代码可在https://github.com/JingXiaolun/PHA-Net获取。
Keyword:
Hierarchical alignment
Prototype diversity
Prototype token
Text-video retrieval

期刊

Neurocomputing 封面图
Neurocomputing
IF:
6.5
论文数:
2.5W
被引数:
6.5W

机构

S
Shanghai Jiao Tong University
学者数:
4.9K
论文数: 1.4K
被引数: 0
O
oregon health & science university
学者数:
322
论文数: 133
被引数: 0
引用论文

引用论文

暂无论文信息