返回
Vision-language representation learning with breadth and depth attention
DOI:10.1016/j.knosys.2024.112941.png)
摘要
En 中文
计算机视觉和自然语言处理领域的快速进步,使得跨多个领域理解视觉和语言融合的挑战日益受到关注。表示学习已成为跨模态信息理解研究的主要焦点。然而,现有方法往往难以提供全面的交互和有意义的监督指导,从而无法实现有效的视觉-语言联合表示学习。在本文中,我们提出了用于视觉-语言表示学习的广度与深度注意力预训练(BDAP)模型。我们的模型包含一个广度注意力网络,旨在建模不同图像层级中句子文本与图像区域之间的特征关联。该网络利用细粒度图像特征促进更有效的跨模态特征交互。此外,我们设计了一个深度注意力网络,通过重复计算注意力分数,逐步细化与文本相关的重要图像区域,以深入捕捉图像与文本之间的互补性。进一步地,我们提出了一个注意力预训练网络,利用注意力标注分布图作为先验知识来监督广度与深度注意力网络的学习过程,从而实现两种注意力网络的权重初始化。在视觉问答和多模态情感分析数据集上的大量实验表明,我们的BDAP模型在视觉-语言表示学习方面具有显著的优越性。
Keyword:
Representation learning
Attention
Pre-training
期刊
K
IF:
7.6
论文数:
1.2W
被引数:
4.5W
机构
引用论文
Comprehensive-perception dynamic reasoning for visual question answering面向视觉问答的综合感知动态推理
PATTERN RECOGNITION
IF7.6

