arrow
返回

Directional mask-aware diffusion for coherent object-background editing

delete2026-04-01
delete0
PRE
AI
C
Chen, Xiangrui *
S
Si, Qi
W
Wang, Bo
Z
Zhang, Zhao
Y
Ye, Xianming
Y
Yang, Yun
Z
Zhang, Haijun
W
Wang, Meng
DOI:10.1016/j.ins.2026.123462delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
尽管扩散模型在通过文本提示生成多样且高保真图像方面表现出色,但当前的无训练编辑方法难以同时修改前景物体和背景场景。这源于三个关键限制:1)缺乏对特定区域的空间精确结构控制;2)区域指定的不灵活性阻碍了多物体编辑;3)次优编辑方向导致语义引导不准确。为解决这些挑战,我们提出了一种无训练编辑框架,通过协调语义操作与结构保持,促进物体-背景协同编辑。我们提出Mask-Restricted Self-Attention Guidance,通过物体特定的token追踪和掩码约束注意力来保持几何完整性。对于语义操作,我们引入Mask-Restricted Cross-Attention,它注入基于我们新颖的Random Token Direction Calculation的区域自适应方向引导。该方法通过随机采样直接从潜在梯度中提取语义偏移,消除了对外部语言模型的依赖。结合掩码约束的注意力图,它确保了精确的内容修改,并通过噪声正则化对精炼的潜在表示进行增强。大量实验表明,我们的框架在编辑保真度和多物体编辑能力方面优于基线方法。
Keyword:
Diffusion models
Training-free
Mask-restricted attention
Image editing

期刊

Information Sciences 封面图
Information Sciences
IF:
6.8
论文数:
553
被引数:
6.2W

机构

H
Hebei University of Technology
学者数:
3.5K
论文数: 1.0K
被引数: 1.7W
U
university of pretoria
学者数:
1.2W
论文数: 9.9K
被引数: 6
Y
yunnan university
学者数:
4.3K
论文数: 1.4K
被引数: 0
H
Hefei University of Technology
学者数:
6.2K
论文数: 2.0K
被引数: 2.1W
H
Harbin Institute of Technology
学者数:
1.6W
论文数: 5.0K
被引数: 8.5W
学者 查看更多机构
引用论文

引用论文

暂无论文信息