返回
Optimizing medical image report generation through a discrete diffusion framework
DOI:10.1007/s11227-025-07111-2.png)
摘要
En 中文
医学影像,如X射线和CT扫描,在诊断中发挥着关键作用,但日益增加的工作量导致报告延迟和潜在错误。基于传统深度学习的方法在捕捉长篇医学报告中的复杂语义关系时往往存在困难,导致生成文本的连贯性和一致性出现问题。为解决这些挑战,我们提出了一种基于扩散模型的新型多阶段生成框架。该框架整合了交叉注意力机制,能够同时关注文本和视觉特征,显著提升了模型将图像内容与准确文本描述对齐的能力。此外,我们通过集成跳跃连接、长短期记忆网络(LSTM)和MIX-MLP网络来优化多模态信息融合,增强了不同模态间的信息流动。通过集成先进的多模态融合机制,我们的方法提升了自动报告生成的准确性和连贯性。该模型在IU-XRAY和MIMIC-CXR数据集上进行了评估,在BLEU、METEOR和ROUGE等多个指标上实现了最先进的表现,显著超越了先前的方法。这些结果验证了该框架在生成专业且连贯的医学报告方面的有效性,提供了一种可靠的解决方案以减轻手动报告的负担。源代码可访问https://github.com/watersunhznu/DifMIRG。
Keyword:
Medical image report generation
Diffusion models
Image-to-text generation
Multimodal fusion
期刊
IF:
2.7
论文数:
1.1K
被引数:
1.0W
机构
引用论文
Integrating Medical Imaging and Clinical Reports Using Multimodal Deep Learning for Advanced Disease Analysis利用多模态深度学习整合医学影像与临床报告进行高级疾病分析
Automatic Generation of Medical Imaging Diagnostic Report with Hierarchical Recurrent Neural Network

