返回
Syntactic-Conditional Diffusion Networks for Controllable Image Captioning
DOI:10.1145/3748653.png)
摘要
En 中文
当前基于扩散模型的自底向上图像描述生成方法通常聚焦于以非自回归方式生成描述。然而,在运用此类生成模型控制离散词语生成的同时追求多样性与准确性的平衡并非易事。受连续扩散在图像描述生成中成功的启发,我们将词性(POS)信息和自由分类器引导引入扩散模型,并提出一种新颖的可控图像描述生成模型,即词性条件扩散网络(POSCD-Net),其由基于扩散的词性生成器(DPG)和基于扩散的描述生成器(DCG)组成。DPG旨在为每个输入图像生成多样的句法结构。多样的POS序列进一步作为DCG的控制信号,在条件扩散过程中生成输出句子。在DCG中,设计了一个句法控制模块(SCM),以级联方式逐步强化词语与对应词性标签的对齐。此外,为提升POSCD-Net的可控性,利用带可学习参数的自由分类器引导,以非自回归方式联合优化DPG和DCG。在MSCOCO数据集上的大量实验表明,我们提出的方法优于当前最先进的非自回归方法,且相较于自回归模型表现出有前景的性能。

