返回
OMR-diffusion: Optimizing multi-round enhanced training in diffusion models for improved intent understanding
DOI:10.1016/j.neucom.2025.131452.png)
摘要
En 中文
• 优化图像生成中的用户偏好:本研究引入了一种视觉协同适应(VCA)框架,该框架整合了人类反馈和强化学习(RL),以使生成的图像与个性化用户偏好保持一致,同时确保多轮对话中的连贯性。
• 通过多轮反馈改进生成效果:基于对话的优化利用每一步的用户反馈来提升图像的多样性、结构一致性和语义对齐,显著推动了文本到图像的生成技术。
• 通过反馈循环增强交互:动态奖励系统在多样性、一致性和互信息之间取得平衡,以提升交互质量并降低使用AI技术的门槛。
• 超越当前最优性能:所提出的模型在意图对齐、图像一致性和对话效率方面超越了DALL-E 3和Imagen等先进系统,并在LPIPS(0.15)和BLIP(0.59)指标上取得了顶尖结果。
期刊
IF:
6.5
论文数:
2.5W
被引数:
6.5W
机构
引用论文
暂无论文信息

