arrow
返回

ML-GAN: Multi-level Text-driven Fine-grained Image Generation using Generative Adversarial Network

delete2025-07-11
delete0
PRE
AI
H
Hong Zhao
王
王贺 (He Wang) *
Y
Yongjuan Yang
DOI:10.1016/j.neucom.2025.130851delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
文本到图像生成旨在将输入文本转换为语义准确且视觉真实的图像。现有方法通常使用句子级文本生成图像的通用轮廓,然后用单词级文本进行细化。然而,这种直接从粗粒度到细粒度文本特征跳跃的方法,使得模型难以精确细化图像。为解决此问题,我们提出了一种基于生成对抗网络的多级文本驱动的精细图像生成(ML-GAN)。该模型利用不同层次级别的文本信息,逐步构建和优化生成的图像。我们设计了双级文本并行融合模块(DPFM)和三级文本并行融合模块(TPFM),通过利用不同级别的文本信息,精确调整和优化图像细节。此外,为增强文本与生成图像之间的语义一致性,我们在判别器中引入了一个跨模态注意力融合模块,以提高其识别文本-图像匹配的能力,从而引导生成器产生与文本内容更匹配的图像。与基线模型相比,我们提出的模型在CUB和COCO数据集上的FID分数分别提高了19.10%和12.99%。这验证了多级文本到图像转换方法在提升生成图像质量方面的有效性。
Keyword:
text-to-image generation
multi-level text features
generative adversarial networks
fine-grained image generation
cross-modal attention

期刊

Neurocomputing 封面图
Neurocomputing
IF:
6.5
论文数:
2.5W
被引数:
6.5W

机构

暂无机构信息
引用论文

引用论文

暂无论文信息