返回
Comparing supervised machine learning and large language models in title-abstract screening
DOI:10.1186/s13643-026-03199-6.png)
摘要
En 中文
系统综述需要评审者决定从数据库检索中获取的大量文章的入选资格。为在文献持续增加的情况下加速评审过程,既往研究提出了通过有监督机器学习或大型语言模型自动化标题/摘要筛选步骤。鉴于先前研究主要比较同一模型家族内的结果,我们直接比较了常见的基于TF-IDF的有监督基线模型和一种零样本、基于标准提示、开放权重的语言模型,以探讨它们在何种情况下适用于评审筛选自动化。我们使用四种有监督机器学习模型(朴素贝叶斯、支持向量机、随机森林、逻辑回归)和一种大型语言模型(Llama-3.1—8B-Instruct)预测已标注文章的入选资格,文章由六项系统综述中的人类评审者标注。我们通过二元混淆矩阵评估性能,并计算每千次自助采样中的召回率、特异度、精确率、F1分数和准确率。我们将结果与单人类评审者报告的性能(召回率0.86,特异度0.79)进行比较。模型性能在不同数据集上差异显著。除朴素贝叶斯外,有监督机器学习模型的召回率和特异度比Llama更接近人类水平。在所有数据集上平均,Llama达到人类召回率,朴素贝叶斯分类器超过人类召回率,但两者均低于人类特异度。相反,逻辑回归、随机森林和支持向量机的召回率低于人类,但三者均超过人类特异度。有监督机器学习和大型语言模型均达到接近或高于人类评审者的召回率。有监督机器学习模型在召回率和特异度的调和平均值上更高,而Llama模型更敏感。考虑到对训练数据的依赖和有监督机器学习的全有或全无自动化特点,本研究结果支持其在扩展现有非关键系统综述中的应用。相反,由于大型语言模型对文章进行个体决策并提供全面、可讨论的推理,它们可与人评审者协同使用,而大型语言模型集成的性能有待分析。
Keyword:
Systematic review
Title/abstract-screening
Supervised machine learning
Large language model

