arrow
返回

Scale-aware Multi-head Attention with Explainability for Image Captioning

delete2026-01-01
delete0
PRE
AI
Y
Y ouzhong Guo
X
Xiaodan Zhang
A
Aozhe Jia *
王博岳 (Boyue Wang)
DOI:10.1007/978-981-95-5696-0_7delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
注意力机制,特别是Transformer模型,正主导图像描述生成领域。当前主流方法通常使用网格图像特征作为输入,并利用基于多头注意力机制的编码器-解码器框架来上下文化信息。然而,编码器的自注意力机制仅捕获固定尺寸网格特征之间的视觉关系,未能考虑不同对象尺度,这影响了视觉特征表示和描述质量。为解决此问题,我们提出了一种新颖的尺度感知多头注意力(SMA)机制,通过引入尺度扩展算法到注意力中,充分利用多尺度视觉特征进行图像描述生成。具体而言,多头注意力中的每个头将不同高尺度特征整合到固定低尺度网格特征中,从而捕获更多样化、更丰富的信息。尽管SMA性能优异,但视觉语言生成任务也引发了模型可解释性的需求。为更准确地解释所提出的模型,我们引入了多尺度视觉语言解释网络(MVEN)来累积从输入到输出的相关性图。可解释性相关性不仅聚合了多尺度上下文信息,还在视觉和文本层面生成了更具可解释性的注意力热图。
Keyword:
image captioning
scale-aware multi-head attention
attention explainability

期刊

P
PATTERN RECOGNITION AND COMPUTER VISION, PRCV 2025, PT III
IF:
0
论文数:
25
被引数:
0

机构

C
china united network communications limited
学者数:
145
论文数: 121
被引数: 0
B
beijing university of technology
学者数:
5.9K
论文数: 1.9K
被引数: 0