arrow
返回

Vision-language representation learning with breadth and depth attention

delete2025-02-01
delete0
PRE
AI
刘贇 封面图
刘贇 (Yun Liu) *
B
Bo Zhang
C
C. Wang
G
Genglong Yan
K
Ke Zhou
Z
Zhoujun Li
L
Leilei Zhang
DOI:10.1016/j.knosys.2024.112941delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
计算机视觉和自然语言处理领域的快速进步,使得跨多个领域理解视觉和语言融合的挑战日益受到关注。表示学习已成为跨模态信息理解研究的主要焦点。然而,现有方法往往难以提供全面的交互和有意义的监督指导,从而无法实现有效的视觉-语言联合表示学习。在本文中,我们提出了用于视觉-语言表示学习的广度与深度注意力预训练(BDAP)模型。我们的模型包含一个广度注意力网络,旨在建模不同图像层级中句子文本与图像区域之间的特征关联。该网络利用细粒度图像特征促进更有效的跨模态特征交互。此外,我们设计了一个深度注意力网络,通过重复计算注意力分数,逐步细化与文本相关的重要图像区域,以深入捕捉图像与文本之间的互补性。进一步地,我们提出了一个注意力预训练网络,利用注意力标注分布图作为先验知识来监督广度与深度注意力网络的学习过程,从而实现两种注意力网络的权重初始化。在视觉问答和多模态情感分析数据集上的大量实验表明,我们的BDAP模型在视觉-语言表示学习方面具有显著的优越性。
Keyword:
Representation learning
Attention
Pre-training

期刊

K
Knowledge-Based Systems
IF:
7.6
论文数:
1.2W
被引数:
4.5W

机构

M
moutai institute
学者数:
522
论文数: 251
被引数: 11
引用论文

引用论文

Visual-textual sentiment classification with bi-directional multi-level attention networks
err2019-08-01
err53
PREAI
errXu, Jie; Huang, Feiran; Zhang, Xiaoming; Wang, Senzhang; Li, Chaozhuo; Li, Zhoujun; He, Yueying
err分享
err收藏
Long Short-Term Memory长短期记忆
err1997-11-01
err0
PREAI
errSepp Hochreiter; Jürgen Schmidhuber
err分享
err收藏
A new approach to cross-modal multimedia retrieval
err2010-10-25
err0
PREAI
errNikhil Rasiwasia; Jose Costa Pereira; Emanuele Coviello; Gabriel Doyle; Gert R.G. Lanckriet; Roger Levy; Nuno Vasconcelos
err分享
err收藏
学者 查看更多内容