返回
Generalizing machine learning models from clinical free text
DOI:10.1038/s41598-025-17197-6.png)
摘要
En 中文
为评估提升医疗人工智能模型泛化能力的策略,我们分析了应用于医学自由文本的预处理方法的影响,比较了单机构与多机构数据模型,并评估了数据差异度量。基于44家美国机构1,607,393例手术数据,创建了深度神经网络模型以从医学自由文本中分类麻醉学当前 procedural terminology (CPT) 代码。分析了从最小化到自动化(cSpell)并结合全面医师审查的三种文本预处理级别。采用Kullback–Leibler散度和k-中位数聚类预测单机构与多机构模型的性能。单机构模型在内部数据上的平均准确率为92.5% [标准差2.8%]和F1分数0.923 [0.029],但在外部数据上泛化性能较差(准确率下降22.4% [7.0%]; F1下降0.223 [0.081])。自由文本预处理对性能影响极小(准确率提升0.51% [2.23]; F1提升0.004 [0.020])。全机构联合模型在内部数据上表现略差(准确率下降4.88% [2.43%]; F1下降0.045 [0.020]),但对外部数据的泛化能力显著提升(准确率提升17.1% [8.7%]; F1提升0.182 [0.073])。与词汇重叠度和Jaccard相似度相比,Kullback–Leibler散度与模型性能的相关性更强(R²分别为0.41、0.16和0.08),并成功聚类机构及识别异常数据。总体而言,医学自由文本预处理在提升机器学习模型泛化能力方面的作用有限;单机构模型表现最佳但泛化能力差,而联合数据模型虽提升泛化能力却未能达到单机构模型的性能水平。Kullback–Leibler散度作为可靠的启发式方法为评估泛化性提供了重要见解。这些结果对开发广泛应用的医疗人工智能应用具有重要启示,为相关开发与评估提供了宝贵参考。
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
3.9
论文数:
28.0W
被引数:
83.5W
机构
引用论文
Task definition, annotated dataset, and supervised natural language processing models for symptom extraction from unstructured clinical notes任务定义、注释数据集和监督自然语言处理模型,用于从非结构化临床笔记中提取症状
Machine learning for medical imaging: methodological failures and recommendations for the future医学成像的机器学习: 方法学上的失败和对未来的建议
NPJ DIGITAL MEDICINE
IF15.1

