arrow
返回

A deep learning-based system for automated image caption synthesis

delete2026-02-01
delete0
PRE
AI
C
Chevella Anil Kumar *
P
Pravallika, Ambati
Y
Y. Chalapathi Rao
DOI:10.1088/2631-8695/ae4448delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
图像字幕生成技术整合了自然语言处理(NLP)和计算机视觉,以自主生成图像的文字描述。本研究提出了一种利用深度学习的图像字幕生成系统,该系统结合了卷积神经网络(CNN)、长短期记忆网络(LSTM)和视觉注意力机制(CNN+LSTM+Attention)。该模型在生成字幕时强调对相关图像区域的动态注意力,通过提高字幕准确性和生成更具上下文相关性的描述,区别于传统模型。该模型在Flickr8k数据集上进行评估,并与几种最先进的方法进行比较,包括基于Transformer的模型、ResNet-101+SA-Bi-LSTM以及引导视觉注意力(GVA)。所提出的模型表现出增强的性能,达到BLEU-4 0.76、METEOR 0.30和ROUGE-L 0.64的得分,从而超越了传统模型和更先进的Transformer-based方法。结果表明,所提出的机制在生成相关且精确的图像字幕方面是有效的。所提出的注意力机制有助于集中关注图像的关键区域。本文展示了所提出模型相较于当前最先进(SOTA)技术的优势,并强调了未来研究方向,包括引入量子启发和Transformer-based模型以增强模型能力。
Keyword:
artificial intelligence
convolutional neural network
long short-term memory
flick8k
image caption
visual attention
Word2vec

期刊

E
Engineering Research Express
IF:
1.6
论文数:
2.1K
被引数:
0

机构

引用论文

引用论文

GVA: guided visual attention approach for automatic image caption generation
err2024-01-29
err15
PREAI
errHossen, Md. Bipul; Ye, Zhongfu; Abdussalam, Amr; Hossain, Md. Imran
err分享
err收藏
Explainability in image captioning based on the latent space
err2023-08-01
err2
errOAAI
errElguendouze, Sofiane; Hafiane, Adel; de Souto, Marcilio C. P.; Halftermeyer, Anais
err分享
err收藏
A region-based image caption generator with refined descriptions
err2018-01-01
err76
errOAAI
errKinghorn, Philip; Zhang, Li; Shao, Ling
err分享
err收藏
学者 查看更多内容