返回
FoodDiff: A Collaborative Relationship Perception Framework for Food Image Synthesis Using Diffusion Models
DOI:10.1109/tmm.2026.3654435.png)
摘要
En 中文
食品图像生成是文本到图像(T2I)模型的典型应用。食品图像合成与其他T2I任务的核心区别在于食材、烹饪动作和食品图像之间存在复杂的协作关系,这些关系决定了菜肴的外观。然而,现有的食品图像生成模型通常忽略或未能充分利用这些协作关系,这阻碍了模型精确感知食品的形状和细节。此外,T2I模型的预训练分布通常较为嘈杂,且与用户偏好的食品特征分布不同,导致生成的图像偏离人类审美标准。为解决上述问题,我们提出了FoodDiff,一种面向协作关系的食品图像生成扩散模型,该模型包含三个关键组件:(1)为感知协作关系,我们提出了一个协作关系模块,用于提取这些关系并将其注入图像生成过程;(2)为充分交互食谱语义与食品表示之间的关系,我们提出了一个食谱融合微调模块,用于精确融合食谱语义与视觉特征,并对预训练模型进行微调;(3)为使预训练特征分布符合人类偏好,我们引入了图像奖励反馈机制以优化食品图像的审美质量。此外,我们提出了一个高质量食品数据集Food-Aesthetic,包含精美的盘饰和详细的标注。大量实验和人工评估表明,FoodDiff在图像审美质量和语义一致性方面具有显著优势。
Keyword:
Collaboration
Image synthesis
Diffusion models
Visualization
Semantics
Text to image
Noise reduction
Feature extraction
Telecommunications
Generators
Text-to-image generation
aesthetic food images
diffusion model
image reward feedback
期刊
IF:
9.7
论文数:
4.5K
被引数:
2.4W
机构
引用论文
暂无论文信息

