arrow
返回

Controllable Generation With Text-to-Image Diffusion Models: A Survey

delete2025-12-19
delete0
PRE
AI
F
Feng Zhou
Q
Qing Song
L
Lu Yang
DOI:10.1109/TPAMI.2025.3646548delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
在视觉生成领域快速发展的背景下,扩散模型已彻底改变了该领域的格局,凭借其出色的文本引导生成功能,显著提升了能力。然而,仅依赖文本对这些模型进行条件控制,无法完全满足不同应用和场景的多样性与复杂性需求。认识到这一不足,多项研究致力于控制预训练的文本到图像(T2I)模型,以支持新型条件输入。本综述对基于T2I扩散模型的可控生成文献进行了全面回顾,涵盖了该领域的基础理论与实际进展。我们的综述首先简要介绍了去噪扩散概率模型(DDPMs)的基础知识以及广泛应用的T2I扩散模型。此外,我们从条件控制的角度,将相关研究分为三个方向进行概述:基于特定条件的生成、基于多条件的生成以及通用可控生成。针对每个类别,我们分析了其底层控制机制,并基于核心技术对代表性方法进行了综述。
Keyword:
Survey
text-to-image diffusion model
controllable generation
AIGC

期刊

IEEE Transactions on Pattern Analysis and Machine Intelligence 封面图
IEEE Transactions on Pattern Analysis and Machine Intelligence
IF:
18.6
论文数:
1.0K
被引数:
9.8W

机构

B
beijing university of posts and telecommunications
学者数:
2.3K
论文数: 861
被引数: 0
引用论文

引用论文

LCM-Lookahead for Encoder-Based Text-to-Image Personalization
err2025-01-01
err0
PREAI
errGal,Rinon; Lichter,Or; Richardson,Elad; Patashnik,Or; Bermano,Amit H.; Chechik,Gal; Cohen-Or,Daniel
err分享
err收藏
C3Net: Compound Conditioned ControlNet for Multimodal Content Generation
err
IF0
err2024-06-16
err0
PREAI
errJuntao Zhang; Yuehuai Liu; Yu-Wing Tai; Chi-Keung Tang
err分享
err收藏
err分享
err收藏
err分享
err收藏
PartCraft: Crafting Creative Objects by Parts
err2025-01-01
err0
PREAI
errNg,Kam Woh; Zhu,Xiatian; Song,Yi-Zhe; Xiang,Tao
err分享
err收藏
MagicTailor: Component-Controllable Personalization in Text-to-Image Diffusion Models
err2024-08-01
err0
PREAI
errZhou,Donghao; Huang,Jiancheng; Bai,Jinbin; Wang,Jiaze; Chen,Hao; Chen,Guangyong; Hu,Xiaowei; Heng,Pheng-Ann
err分享
err收藏
学者 查看更多内容