返回
Enhancing visual contextual semantic information for image captioning
DOI:10.1007/s13042-025-02634-9.png)
摘要
En 中文
图像描述生成是多模态领域的一项基础任务,其目标是通过深度网络处理将图像转化为连贯的文本。简单的网格特征往往表现不佳,这是因为其缺乏上下文信息且存在过多噪声。本文旨在通过在原始Transformer模型框架内增强细粒度网格特征以融合上下文语义信息来解决这些问题。我们提出了一个新的空洞注意力融合Transformer(DAFT)。首先,我们通过基于交叉注意力的特征融合模块整合语义分割特征,以全面捕捉与对象相关的信息。随后,我们提出了一种基于网格的多尺度多头稀疏注意力机制,该机制在提升粒度的同时减少不必要的噪声和计算成本。此外,我们采用加权残差连接方法来融合多层信息,生成更丰富的表示。在MS-COCO数据集上的大量实验证明了DAFT的有效性,CIDEr指标从133.2提升至135.7%,相较于基线模型实现了显著性能提升。源代码可访问https://github.com/lishuo19981027/DAFT。
Keyword:
Image captioning
Dilated attention
Transformer
期刊
IF:
2.7
论文数:
3.2K
被引数:
5.6K

