返回
Validating large language model-assisted data extraction from clinical notes
DOI:10.1016/j.esmorw.2026.100718.png)
摘要
En 中文
背景:医疗专业人员面临日益增加的文档负担,这可能影响效率和患者安全。大型语言模型(LLMs)可通过自动化从非结构化临床记录中提取数据,提供可扩展的解决方案。本研究评估了在头颈肿瘤咨询背景下,由LLM进行的结构化数据提取与医生手动提取相比的准确性和临床影响。患者与方法:这是一项前瞻性验证研究,比较了LLM驱动的数据提取与手动提取。分析了60名患者(1482页)的临床文档。由两名医生和一个预训练的开源LLM提取29个临床相关类别的数据。六名临床专家采用两步程序评估了2555个提取值:首先,对LLM输出与人工共识之间的匹配/不匹配进行盲法二元评估;其次,将所有不匹配项归类为预定义的错误类型(错误、不完整、缺失、幻觉或过度完整)。这些专家分配的标签用于计算准确率、精确率、召回率和F1分数。使用配对t检验比较提取时间,并使用5分量表评估错误影响。结果:LLM驱动的提取准确率在74%(病理学:95%置信区间[CI] 65%至82%)至90%(患者特征:95%CI 87%至94%)之间。手动提取显示29%的观察者间分歧(95%CI 25.19%至32.74%)。在2555个提取值中,68个被评为高影响错误,尽管评估者的评估差异很大。幻觉很少见(0.16%),且影响较低。LLM提取将每例平均时间从8.6分钟减少到1.9分钟(P < 0.001)。结论:在确保人工监督的前提下,LLMs可以通过减少文档时间并保持可接受的准确性来支持临床工作流程。这些发现支持在临床实践中进一步探索AI辅助文档工具。
Keyword:
administrative burden
information extraction
large language model (LLM)
oncology
real-world data
validation

