arrow
返回

Syntactic-Conditional Diffusion Networks for Controllable Image Captioning

delete2025-09-10
delete0
PRE
AI
刘冰 封面图
刘冰 (Bing Liu)
W
Wenjie Yang
M
Mingming Liu
H
Hao Liu
Y
Yong Zhou
P
Peng Liu
DOI:10.1145/3748653delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
当前基于扩散模型的自底向上图像描述生成方法通常聚焦于以非自回归方式生成描述。然而,在运用此类生成模型控制离散词语生成的同时追求多样性与准确性的平衡并非易事。受连续扩散在图像描述生成中成功的启发,我们将词性(POS)信息和自由分类器引导引入扩散模型,并提出一种新颖的可控图像描述生成模型,即词性条件扩散网络(POSCD-Net),其由基于扩散的词性生成器(DPG)和基于扩散的描述生成器(DCG)组成。DPG旨在为每个输入图像生成多样的句法结构。多样的POS序列进一步作为DCG的控制信号,在条件扩散过程中生成输出句子。在DCG中,设计了一个句法控制模块(SCM),以级联方式逐步强化词语与对应词性标签的对齐。此外,为提升POSCD-Net的可控性,利用带可学习参数的自由分类器引导,以非自回归方式联合优化DPG和DCG。在MSCOCO数据集上的大量实验表明,我们提出的方法优于当前最先进的非自回归方法,且相较于自回归模型表现出有前景的性能。

期刊

ACM Transactions on Multimedia Computing Communications and Applications 封面图
ACM Transactions on Multimedia Computing Communications and Applications
IF:
6
论文数:
2.0K
被引数:
5.4K

机构

暂无机构信息
引用论文

引用论文