返回
Enhancing dermoscopic image generation via multi-modal conditional diffusion models
DOI:10.1016/j.neucom.2026.134813.png)
摘要
En 中文
近期扩散模型的发展在缓解皮肤镜图像生成中的数据稀缺方面显示出前景。然而,现有方法通常缺乏对关键细节(如疾病模式和病灶定位)的精确控制。这一限制阻碍了皮肤镜分析所需的精细语义生成和空间精度。为解决此问题,我们提出了一种新型多模态条件扩散模型(MMC-Diff),利用多种模态(如皮肤科特定文本和图像)来约束生成过程。首先,我们开发了一种基于预训练视觉-语言模型推导的皮肤科特定文本描述的潜在扩散模型。其次,我们提出了一种低成本的空间掩码适配器,使模型内部知识与外部控制信号对齐,从而在图像生成过程中实现精确的空间控制。实验结果表明,基于FID和IS等指标,我们的模型在生成质量上达到了与当前最佳方法相当的水平。MMC-Diff有效提升了皮肤镜数据集的质量和多样性。
期刊
IF:
6.5
论文数:
2.5W
被引数:
6.5W
机构
引用论文
暂无论文信息

