返回
Deep Multi-sentence Aligned Cross-Modal Retrieval
DOI:10.1007/978-981-95-3398-5_10.png)
摘要
En 中文
当前跨模态检索模型主要依赖一对一图像-文本配对进行训练,大多数方法将每个样本投影到单个嵌入向量中。然而,近期研究表明,这种单向量表示无法捕捉图像和文本的固有复杂性,导致嵌入过程中关键语义信息的丢失。因此,这些模型通常难以有效学习两种模态的细微特征。在本文中,我们提出了一种新的训练策略,从传统的“一对一”图像-文本配对过渡到“一对多”框架,并引入了一种具有权重的创新集合预测模块,以更好地捕捉输入数据的多维语义。通过在训练中纳入更多样化的文本表示,我们的方法显著提升了跨模态检索模型的性能。在COCO和Flickr30K数据集上针对多种骨干网络进行的广泛评估表明,我们的方法持续优于大多数现有方法。
Keyword:
cross-modal retrieval
multiple matching relations
set prediction module with weight
ambiguity issue

