返回
StructFuse: Harmonizing multiple structural cues for diffusion-driven image compositing
DOI:10.1016/j.patcog.2026.114609.png)
摘要
En 中文
将视觉上连贯的前景和背景元素合成仍是在生成式图像编辑中的关键挑战。基于扩散的主流方法要么依赖刚性的图像级输入,这限制了场景多样性,要么专注于局部掩码条件(如边缘、深度),但在有效结合多个结构线索方面存在困难。为解决这些局限性,我们提出了一种先进的基于扩散的框架,通过使用结构化视觉线索实现精确的前景-背景融合。我们的方法引入了三项关键创新:(1)一种可学习的自适应门控策略,动态融合多个结构线索(边缘、轮廓和深度),同时有效捕捉更丰富和平衡的条件表示;(2)一种双向特征调制方法,在扩散U-Net编解码层次结构中注入多分辨率控制信号,显著提升合成质量;(3)一种基于掩码的交叉注意力机制,将文本影响隔离到用户指定区域,消除语义渗透。此外,我们提出了一种构建针对图像合成任务的合成图像数据集的新流程。实验结果表明,我们的框架在Harmony Score、FID、SSIM、CLIP Score和MUSIQ等基准指标上优于当前最优的基线方法,体现了强大的合成完整性和视觉连贯性。该方法为合成图像生成提供了一种可扩展且可扩展的解决方案,在合成数据集生成、创意内容设计和增强现实等领域具有广泛应用。
Keyword:
Image compositing
Image harmonization
Multi-modal structural fusion
Synthetic data generation
Diffusion model

