arrow
Return

DiffBlender: Composable and versatile multimodal text-to-image diffusion models

delete2025-08-19
delete0
PRE
AI
S
Sungnyun Kim
J
Junsoo Lee
K
Kibeom Hong
D
Daesik Kim
N
Namhyuk Ahn
DOI:10.1016/j.eswa.2025.129345delete
deleteOriginal
deleteOriginal request for help
deleteShare
deleteSave
Abstract

Abstract

En 中文
• Introduces DiffBlender to unify multiple input modalities—structure, layout, and attribute—within a single T2I framework. • Utilizes a compact “Blender block” that preserves the pre-trained diffusion parameters, minimizing additional training overhead. • Enables efficient multimodal generation and composability across diverse conditions and user preferences. • Proposes mode-specific guidance for precise control over each modality, ensuring balanced and high-fidelity image synthesis.
Keywords:
DiffBlender
multimodal generation
text-to-image synthesis
diffusion models
modality-specific guidance

Journal

Expert Systems with Applications cover
Expert Systems with Applications
IF:
7.5
Papers:
2.9W
Citations:
10.2W

Organization

K
kaist ai
Scholars:
1
Papers: 1
Citations: 0
N
naver webtoon ai
Scholars:
5
Papers: 2
Citations: 0
I
Inha University
Scholars:
1.1W
Papers: 1.1W
Citations: 1.1W
researcher View more organizations