arrow
返回

Enhancing visual contextual semantic information for image captioning

delete2025-05-11
delete0
PRE
AI
R
Ronggui Wang
S
Shuo Li
L
Lixia Xue
杨
杨娟 (Juan Yang) *
DOI:10.1007/s13042-025-02634-9delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
图像描述生成是多模态领域的一项基础任务,其目标是通过深度网络处理将图像转化为连贯的文本。简单的网格特征往往表现不佳,这是因为其缺乏上下文信息且存在过多噪声。本文旨在通过在原始Transformer模型框架内增强细粒度网格特征以融合上下文语义信息来解决这些问题。我们提出了一个新的空洞注意力融合Transformer(DAFT)。首先,我们通过基于交叉注意力的特征融合模块整合语义分割特征,以全面捕捉与对象相关的信息。随后,我们提出了一种基于网格的多尺度多头稀疏注意力机制,该机制在提升粒度的同时减少不必要的噪声和计算成本。此外,我们采用加权残差连接方法来融合多层信息,生成更丰富的表示。在MS-COCO数据集上的大量实验证明了DAFT的有效性,CIDEr指标从133.2提升至135.7%,相较于基线模型实现了显著性能提升。源代码可访问https://github.com/lishuo19981027/DAFT。
Keyword:
Image captioning
Dilated attention
Transformer

期刊

International Journal of Machine Learning and Cybernetics 封面图
International Journal of Machine Learning and Cybernetics
IF:
2.7
论文数:
3.2K
被引数:
5.6K

机构

H
hefei univ technol
学者数:
1.9K
论文数: 759
被引数: 248
引用论文

引用论文

BLEU布卢
err2001-01-01
err0
errOAAI
errKishore Papineni; Salim Roukos; Todd Ward; Wei-Jing Zhu
err分享
err收藏
Dual-level Collaborative Transformer for Image Captioning
err2021-05-18
err0
errOAAI
errYunpeng Luo; Jiayi Ji; Xiaoshuai Sun; Liujuan Cao; Yongjian Wu; Feiyue Huang; Chia-Wen Lin; Rongrong Ji
err分享
err收藏
UPSNet: A Unified Panoptic Segmentation Network
err2019-06-01
err0
errOAAI
errYuwen Xiong; Renjie Liao; Hengshuang Zhao; Rui Hu; Min Bai; Ersin Yumer; Raquel Urtasun
err分享
err收藏
SPT: Spatial Pyramid Transformer for Image Captioning
err2024-06-01
err0
PREAI
errHaonan Zhang; Pengpeng Zeng; Lianli Gao; Xinyu Lyu; Jingkuan Song; Heng Tao Shen
err分享
err收藏
学者 查看更多内容