arrow
返回

OMR-diffusion: Optimizing multi-round enhanced training in diffusion models for improved intent understanding

delete2025-10-09
delete0
PRE
AI
K
Kun Li
J
Jianhui Wang
Y
Yangfan He
M
Miao Zhang *
王学谦 (Xueqian Wang)
DOI:10.1016/j.neucom.2025.131452delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
• 优化图像生成中的用户偏好:本研究引入了一种视觉协同适应(VCA)框架,该框架整合了人类反馈和强化学习(RL),以使生成的图像与个性化用户偏好保持一致,同时确保多轮对话中的连贯性。 • 通过多轮反馈改进生成效果:基于对话的优化利用每一步的用户反馈来提升图像的多样性、结构一致性和语义对齐,显著推动了文本到图像的生成技术。 • 通过反馈循环增强交互:动态奖励系统在多样性、一致性和互信息之间取得平衡,以提升交互质量并降低使用AI技术的门槛。 • 超越当前最优性能:所提出的模型在意图对齐、图像一致性和对话效率方面超越了DALL-E 3和Imagen等先进系统,并在LPIPS(0.15)和BLIP(0.59)指标上取得了顶尖结果。

期刊

Neurocomputing 封面图
Neurocomputing
IF:
6.5
论文数:
2.5W
被引数:
6.5W

机构

T
tsinghua university
学者数:
11.9W
论文数: 10.0W
被引数: 137
U
university of electronic science and technology of china
学者数:
1.3W
论文数: 4.8K
被引数: 4
X
xiamen university
学者数:
5.9W
论文数: 3.8W
被引数: 67
学者 查看更多机构
引用论文

引用论文

暂无论文信息