arrow
返回

A unified multi-modal latent diffusion framework with modality-dropout training

delete2026-09-16
delete0
delete
OA
AI
DOI:10.3389/frai.2026.1867917delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
引言 潜扩散模型中的多模态条件(结合文本、结构和空间指导信号)显著提高了可控图像合成,但现有框架普遍存在两个局限性。首先,条件模态通过固定架构权重融合,这些权重不随输入变化,无法实现输入自适应的指导再平衡。其次,大多数现有多模态方法假设所有条件信号在推理时均存在,导致模型在部分模态缺失时无法优雅降级。本文提出一种统一的潜扩散框架,同时解决这两项局限。 方法 我们的架构整合三种互补条件模态——通过CLIP的语义文本嵌入、基于Canny边缘检测的结构边界图以及来自分割掩码的区域语义布局——作为同等输入引入单一U-Net去噪骨干网络。该框架包含两个核心组件:Softmax归一化自适应指导融合(SNAGF),其用三个可学习、Softmax归一化的模态重要性分数替代固定融合权重,并与扩散目标端到端优化;以及模态随机丢弃训练(MDT),一种结构化正则化策略,在训练时以概率pdrop=0.3随机置零单个指导表示,训练模型在任意可用条件输入子集下生成连贯输出。 结果 在CIFAR-10上评估,完整SNAGF+MDT框架达到SSIM 0.93、FID 17.2、PSNR 34.1 dB、CLIP得分0.88、LPIPS 0.09和IS 10.4。仅MDT在部分条件推理配置中平均提升FID 15.5%,学习的SNAGF权重收敛至λtext=0.370、λedge=0.363、λseg=0.267,表明从第30个epoch起稳定收敛。结果为三个随机种子的平均值。 讨论 综合来看,自适应模态加权优于固定条件策略,而模态随机丢弃训练提供了有效的部分条件鲁棒性机制。所有发现基于32×32分辨率、单一基准及算法构造条件信号;在更高分辨率数据集上使用自然配对文本和结构标注的验证,是推广这些结论前的必要步骤。
Keyword:
U-Net,CLIP,adaptive guidance fusion controllable image synthesis,CIFAR-10,Latent diffusion models,modality dropout,multi-modal conditioning

期刊

F
Frontiers in Artificial Intelligence
IF:
4.7
论文数:
2.4K
被引数:
4.4K

机构

暂无机构信息