返回
Directional mask-aware diffusion for coherent object-background editing
DOI:10.1016/j.ins.2026.123462.png)
摘要
En 中文
尽管扩散模型在通过文本提示生成多样且高保真图像方面表现出色,但当前的无训练编辑方法难以同时修改前景物体和背景场景。这源于三个关键限制:1)缺乏对特定区域的空间精确结构控制;2)区域指定的不灵活性阻碍了多物体编辑;3)次优编辑方向导致语义引导不准确。为解决这些挑战,我们提出了一种无训练编辑框架,通过协调语义操作与结构保持,促进物体-背景协同编辑。我们提出Mask-Restricted Self-Attention Guidance,通过物体特定的token追踪和掩码约束注意力来保持几何完整性。对于语义操作,我们引入Mask-Restricted Cross-Attention,它注入基于我们新颖的Random Token Direction Calculation的区域自适应方向引导。该方法通过随机采样直接从潜在梯度中提取语义偏移,消除了对外部语言模型的依赖。结合掩码约束的注意力图,它确保了精确的内容修改,并通过噪声正则化对精炼的潜在表示进行增强。大量实验表明,我们的框架在编辑保真度和多物体编辑能力方面优于基线方法。
Keyword:
Diffusion models
Training-free
Mask-restricted attention
Image editing
期刊
IF:
6.8
论文数:
553
被引数:
6.2W
机构
引用论文
暂无论文信息

