返回
Controllable Generation With Text-to-Image Diffusion Models: A Survey
DOI:10.1109/TPAMI.2025.3646548.png)
摘要
En 中文
在视觉生成领域快速发展的背景下,扩散模型已彻底改变了该领域的格局,凭借其出色的文本引导生成功能,显著提升了能力。然而,仅依赖文本对这些模型进行条件控制,无法完全满足不同应用和场景的多样性与复杂性需求。认识到这一不足,多项研究致力于控制预训练的文本到图像(T2I)模型,以支持新型条件输入。本综述对基于T2I扩散模型的可控生成文献进行了全面回顾,涵盖了该领域的基础理论与实际进展。我们的综述首先简要介绍了去噪扩散概率模型(DDPMs)的基础知识以及广泛应用的T2I扩散模型。此外,我们从条件控制的角度,将相关研究分为三个方向进行概述:基于特定条件的生成、基于多条件的生成以及通用可控生成。针对每个类别,我们分析了其底层控制机制,并基于核心技术对代表性方法进行了综述。
Keyword:
Survey
text-to-image diffusion model
controllable generation
AIGC
期刊
IF:
18.6
论文数:
1.0K
被引数:
9.8W
机构
引用论文
Initno: Boosting Text-to-Image Diffusion Models via Initial Noise OptimizationInitno: 通过初始噪声优化提升文本到图像扩散模型

