arrow
返回

Optimizing medical image report generation through a discrete diffusion framework

delete2025-03-18
delete0
PRE
AI
S
Shuifa Sun
Z
Zhanglin Su
J
Junsen Meizhou
Y
Yang Feng *
Q
Qin Hu
J
Jiacheng Luo
K
Keyong Hu
Z
Zhen Yang
DOI:10.1007/s11227-025-07111-2delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
医学影像,如X射线和CT扫描,在诊断中发挥着关键作用,但日益增加的工作量导致报告延迟和潜在错误。基于传统深度学习的方法在捕捉长篇医学报告中的复杂语义关系时往往存在困难,导致生成文本的连贯性和一致性出现问题。为解决这些挑战,我们提出了一种基于扩散模型的新型多阶段生成框架。该框架整合了交叉注意力机制,能够同时关注文本和视觉特征,显著提升了模型将图像内容与准确文本描述对齐的能力。此外,我们通过集成跳跃连接、长短期记忆网络(LSTM)和MIX-MLP网络来优化多模态信息融合,增强了不同模态间的信息流动。通过集成先进的多模态融合机制,我们的方法提升了自动报告生成的准确性和连贯性。该模型在IU-XRAY和MIMIC-CXR数据集上进行了评估,在BLEU、METEOR和ROUGE等多个指标上实现了最先进的表现,显著超越了先前的方法。这些结果验证了该框架在生成专业且连贯的医学报告方面的有效性,提供了一种可靠的解决方案以减轻手动报告的负担。源代码可访问https://github.com/watersunhznu/DifMIRG。
Keyword:
Medical image report generation
Diffusion models
Image-to-text generation
Multimodal fusion

期刊

Journal of Supercomputing 封面图
Journal of Supercomputing
IF:
2.7
论文数:
1.1K
被引数:
1.0W

机构

C
china three gorges university
学者数:
1.1W
论文数: 6.1K
被引数: 114
引用论文

引用论文

Self-Critical Sequence Training for Image Captioning
err2017-07-01
err0
errOAAI
errSteven J. Rennie; Etienne Marcheret; Youssef Mroueh; Jerret Ross; Vaibhava Goel
err分享
err收藏
Automatic Generation of Medical Imaging Diagnostic Report with Hierarchical Recurrent Neural Network
err2019-11-01
err0
PREAI
errChangchang Yin; Buyue Qian; Jishang Wei; Xiaoyu Li; Xianli Zhang; Yang Li; Qinghua Zheng
err分享
err收藏
Generative Adversarial Networks生成对抗网络
err2020-10-22
err1.0W
errOAAI
errGoodfellow, Ian; Pouget-Abadie, Jean; Mirza, Mehdi; Xu, Bing; Warde-Farley, David; Ozair, Sherjil; Courville, Aaron; Bengio, Yoshua
err分享
err收藏
学者 查看更多内容