返回
A deep learning-based system for automated image caption synthesis
DOI:10.1088/2631-8695/ae4448.png)
摘要
En 中文
图像字幕生成技术整合了自然语言处理(NLP)和计算机视觉,以自主生成图像的文字描述。本研究提出了一种利用深度学习的图像字幕生成系统,该系统结合了卷积神经网络(CNN)、长短期记忆网络(LSTM)和视觉注意力机制(CNN+LSTM+Attention)。该模型在生成字幕时强调对相关图像区域的动态注意力,通过提高字幕准确性和生成更具上下文相关性的描述,区别于传统模型。该模型在Flickr8k数据集上进行评估,并与几种最先进的方法进行比较,包括基于Transformer的模型、ResNet-101+SA-Bi-LSTM以及引导视觉注意力(GVA)。所提出的模型表现出增强的性能,达到BLEU-4 0.76、METEOR 0.30和ROUGE-L 0.64的得分,从而超越了传统模型和更先进的Transformer-based方法。结果表明,所提出的机制在生成相关且精确的图像字幕方面是有效的。所提出的注意力机制有助于集中关注图像的关键区域。本文展示了所提出模型相较于当前最先进(SOTA)技术的优势,并强调了未来研究方向,包括引入量子启发和Transformer-based模型以增强模型能力。
Keyword:
artificial intelligence
convolutional neural network
long short-term memory
flick8k
image caption
visual attention
Word2vec
期刊
E
IF:
1.6
论文数:
2.1K
被引数:
0
机构
引用论文
SMFE-Net: a saliency multi-feature extraction framework for VHR remote sensing image classificationSmfe-net: 一种用于VHR遥感图像分类的显著性多特征提取框架
Improving pre-trained cnn-lstm models for image captioning with hyper-parameter optimization通过超参数优化改进预训练CNN-LSTM模型用于图像描述生成
Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation基于注意力的Transformer模型用于跨语言图像描述:深入综述与评估
Computer Science Review
IF12.7

