arrow
返回

Validating large language model-assisted data extraction from clinical notes

delete2026-06-01
delete0
delete
OA
AI
V
van Koevorden, J. W. *
A
Aben, N.
S
Struben, V.
A
A. Rollings
K
Kurban, M.
W
Wessels, L.
V
van der Noort, V.
A
Anouk V. M. Burger
V
van Dijk, S. W.
K
Karssemakers, L.
S
Smeele, L.
W
Wouters, M. W. J. M.
D
Dirven, R.
DOI:10.1016/j.esmorw.2026.100718delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
背景:医疗专业人员面临日益增加的文档负担,这可能影响效率和患者安全。大型语言模型(LLMs)可通过自动化从非结构化临床记录中提取数据,提供可扩展的解决方案。本研究评估了在头颈肿瘤咨询背景下,由LLM进行的结构化数据提取与医生手动提取相比的准确性和临床影响。患者与方法:这是一项前瞻性验证研究,比较了LLM驱动的数据提取与手动提取。分析了60名患者(1482页)的临床文档。由两名医生和一个预训练的开源LLM提取29个临床相关类别的数据。六名临床专家采用两步程序评估了2555个提取值:首先,对LLM输出与人工共识之间的匹配/不匹配进行盲法二元评估;其次,将所有不匹配项归类为预定义的错误类型(错误、不完整、缺失、幻觉或过度完整)。这些专家分配的标签用于计算准确率、精确率、召回率和F1分数。使用配对t检验比较提取时间,并使用5分量表评估错误影响。结果:LLM驱动的提取准确率在74%(病理学:95%置信区间[CI] 65%至82%)至90%(患者特征:95%CI 87%至94%)之间。手动提取显示29%的观察者间分歧(95%CI 25.19%至32.74%)。在2555个提取值中,68个被评为高影响错误,尽管评估者的评估差异很大。幻觉很少见(0.16%),且影响较低。LLM提取将每例平均时间从8.6分钟减少到1.9分钟(P < 0.001)。结论:在确保人工监督的前提下,LLMs可以通过减少文档时间并保持可接受的准确性来支持临床工作流程。这些发现支持在临床实践中进一步探索AI辅助文档工具。
Keyword:
administrative burden
information extraction
large language model (LLM)
oncology
real-world data
validation

期刊

E
ESMO Real World Data and Digital Oncology
IF:
0
论文数:
53
被引数:
0

机构

L
leiden university - excl lumc
学者数:
3.5W
论文数: 2.9W
被引数: 46
L
leiden university
学者数:
2.6K
论文数: 1.2K
被引数: 0
L
leiden university medical center (lumc)
学者数:
1.9W
论文数: 1.5W
被引数: 12
N
netherlands cancer institute
学者数:
948
论文数: 348
被引数: 1
学者 查看更多机构