arrow
返回

Ten key considerations for developing interpretable risk prediction models

delete2026-09-12
delete0
delete
OA
AI
DOI:10.3389/fbinf.2026.1878681delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
人工智能(AI)和机器学习(ML)通过实现高维数据分析、自动化模式识别和个体化风险估计,已快速改变了临床风险预测[1]。与传统的回归模型相比,ML算法能够自动学习临床变量间的非线性关系,并通过超参数调优优化预测性能[2]。这些进展推动了在诊断分类和疾病预测方面的成功临床应用。显著案例包括基于DenseNet的多分类甲状腺疾病预测模型,使用Tc-99m闪烁显像[3]、抗菌药物耐药性建模[4,5]以及早期预测感染威胁,如医院获得性感染(HAI)[6]、多药耐药菌(MDRO)[7]和侵袭性大肠杆菌[8]。尽管取得这些成功,当前的风险预测模型仍面临持续的限制。许多模型强调预测准确率,却忽视了可解释性、透明度和可重复性等临床采纳和伦理部署的关键因素[9]。为解决这些方法学差距,本研究提出了一种结构化工作流程,用于开发可解释的风险预测模型(IRPMs),该流程在既定的“透明报告多变量预测模型用于个体预后或诊断(TRIPOD)+人工智能”[10]和“预测模型风险偏差评估工具(PROBAST)+人工智能”[11]指南中整合了可解释性检查点。IRPM框架扩展了传统的十三步预测模型开发、验证和报告流程,通过嵌入可解释性特定里程碑并促进对FAIR原则(可查找性、可访问性、可互操作性、可重用性)[12]的合规性。该工作流程的方法学基础通过一项针对重症监护室(ICU)患者早期大肠杆菌感染预测的近期案例研究进行说明,该研究使用大规模重症监护医学信息 mart IV(MIMIC-IV)数据集[13]。在该研究中,Yang等人(2025)[13]应用最小绝对收缩和选择算子(LASSO)+ Boruta进行特征选择,并构建了八种ML模型,确定了支持向量机(SVM)为最优模型(受试者工作特征曲线下面积(AUC)= 0.745;95%置信区间(CI):0.726-0.764)。值得注意的是,尽管SVM在评估的模型中具有最佳判别能力(AUC = 0.745),但这一性能水平对于临床部署仍然有限,突显了互补可解释性的重要性。应注意的是,该研究作为说明性示例呈现,而非框架本身的基础。IRPM建议旨在泛化到各类临床预测场景。例如,先前的工作[14]表明,不同的类别不平衡校正策略会显著改变校准和判别性能,强调了透明报告重采样决策的重要性。近期国际指南如TRIPOD + AI[10]和PROBAST + AI[11]为AI驱动的预测模型报告和评估设定了全面标准。它们主要关注方法学完整性和偏差风险评估,而非可解释性工作流程。IRPMs工作流程通过引入三项操作可解释性保障措施来补充这些指南:(i) 可解释性检查点,(ii) 解释稳定性测试,以及(iii) 因果合理性评估(表1和补充表S1)。应用于Yang的研究[13],IRPMs阐明了其ML模型+ SHAP管道如何与TRIPOD + AI项目12e(性能+可解释性)和18e-18f(开放科学)[10]的契合,同时指出了改进领域,如亚组公平性分析和外部验证。具体而言,Yang及其同事首先评估了ICU患者当前的大肠杆菌感染风险,然后回顾了使用头孢菌素和侵袭性操作进行早期预测的先前研究[13]。他们识别出对特定ICU人群的稳健、临床可解释ML模型的迫切需求。在设计研究时,关键在于清晰详述创新性:模型是否优于现有方法,或是否在解释临床变量以简化感染监测方面展现出创新。鼓励使用成熟、验证的ML算法(如逻辑回归、随机森林和其他分类模型)以提高透明度和临床可信度。总体而言,在设计研究时,研究人员应明确阐述创新性——无论模型引入了创新的可解释性方法还是增强了临床可用性。IRPMs工作流程通过将TRIPOD + AI的高级报告建议转化为可操作建模步骤来实现这些原则。数据泄露是指验证或测试集的信息意外影响模型训练的情况,这仍然是临床ML中最常见的陷阱之一。防止数据泄露对于维护模型有效性至关重要。常见做法是使用时间验证,在推导和验证数据集之间建立严格的时序分割[15]。TRIPOD + AI指南在第5-12项中要求透明报告数据来源、预处理和分割[10]。在Yang等人的大肠杆菌研究中[13],他们从MIMIC-IV中提取了52,554名ICU患者的 demographics、实验室、合并症和治疗数据。缺失值使用missForest算法[16]进行插补,并通过严格限制在训练折内进行下采样以实现类别平衡[14]。类别不平衡是指阳性结果远少于阴性结果,这可能扭曲性能和公平性。TRIPOD + AI(第13项)要求对重采样和校准进行论证[10]。理想情况下,临床数据可从不同医院或国家收集,但由于患者隐私和各国政策,实现多中心验证可能困难,这可能削弱模型的大规模适用性。在Yang等人的数据集中[13],大肠杆菌感染占病例的7.9%(4,157名患者)。作者应用下采样来平衡类别同时保持数据真实性。替代方法包括合成少数类过采样技术(SMOTE)、自适应合成过采样(ADASYN)、成本敏感学习以及流行率感知阈值优化。虽然过采样可以提高灵敏度,但存在引入合成伪影的风险。下采样保持了真实世界结构,并产生了强大的校准和决策曲线分析(DCA)结果。未来的IRPMs研究应追求多中心数据收集或联邦学习以缓解不平衡并增强泛化能力,这与TRIPOD + AI(第16项)“开发与评估数据之间的差异”[10]一致。研究人员在进行机器学习时常见的问题是应选择回归还是分类模型。模型选择必须在可解释性和预测性能之间取得平衡。TRIPOD + AI(第12c项)[10]为模型选择提供了指导。为确保通过透明超参数调优实现可重复性,一些研究人员倾向于使用嵌套交叉验证(nCV)[19]。在此方法中,每个外部折的分类模型和特征基于内部折验证期间实现最高AUPRC或平衡准确率的组合进行选择。TRIPOD + AI(第12c项)要求报告所有模型构建步骤和调优程序[10]。Yang等人使用了网格搜索和k折交叉验证,强调可重复性而非彻底优化[13]。替代策略包括随机搜索、贝叶斯优化和集成堆叠,这些可以提高性能但引入随机性。TRIPOD + AI合规性工具[10]提供了可重复性评分规则,鼓励研究人员发布调优脚本、固定随机种子和参数网格。未来的IRPMs应包括超参数表格、验证方差和算法选择依据,以支持复制。曲线下面积(AUC)和受试者工作特征曲线(ROC)通常用于评估模型性能,并报告95%置信区间(CI)。TRIPOD + AI(第12e项)建议报告判别力、校准和临床效用[10]。其他性能指标,包括灵敏度、特异度、F1分数、准确率和平衡准确率,也应报告。其不确定性可通过自助重采样(如1,000次重采样)估计。应注意的是,由于临床数据的类别不平衡,如精确率-召回曲线下面积(AUPRC)或平均精度等指标通常比AUC更具信息量。此外,模型性能可能受到一些不确定性的影响,例如使用早期临床数据预测入院期间大肠杆菌感染的研究(如抗生素和导管使用时间)[13],变量可用性的限制和预测所需及时性显著增加了提高模型性能的难度。因此,当模型AUC可解释性能够将统计预测转化为临床见解。TRIPOD + AI(第12e和14项)要求透明解释和公平性评估[10]。当最佳模型具有稳健的校准和由决策分析支持的临床效用时,临床特征可通过SHAP(SHapley加性解释)[20]或局部可解释模型无关解释(LIME)[21]进行解释。可解释性可分为内在(固有透明度,如逻辑回归或决策树)和事后(对复杂模型的外部解释,如集成或神经网络)(补充表S2)。为加强可解释性和确认稳健性,SHAP可与其他XAI方法结合使用(补充表S3和S4)。每个IRPMs都必须透明地承认限制。提及局限性并与相关工作进行比较,以了解当前研究所处的阶段以及未来可能的改进方向,这一点很重要。TRIPOD + AI(第26项)强调透明的局限性讨论为结果提供了背景并增强了可信度。例如,在Yang等人的研究中,大肠杆菌感染患者来自单一中心数据集(MIMIC-IV),缺乏外部、多中心验证,从而限制了其适用于具有不同患者特征和微生物流行病学其他医疗系统的泛化性。没有方法是完美的。常见局限性包括来自缺失数据和插补假设的偏差、尽管有交叉验证但仍存在过拟合风险、可解释性与预测性能之间的权衡、缺乏外部验证以及无法建立因果关系。由于工作量或数据限制,并非总能应用完全稳健、验证的方法来开发稳健、可解释且临床适用的工具。随着数据集的不断增长,深度学习方法,如人工神经网络(ANN)、卷积神经网络(CNN)和循环神经网络(RNN),可被用来自动学习复杂临床和微生物变量之间的高阶非线性关系。重要的是,可解释深度学习的最新进展,包括注意力机制、概念激活向量和反事实解释框架,已在不一定损害预测性能的情况下提高了深度学习模型的可解释性。未来的IRPMs应旨在结合预测能力和解释稳定性与因果合理性,而非将复杂性和可解释性视为对立力量。未来的IRPMs可能会朝着整合结构化电子健康记录(EHR)数据、微生物报告、影像学和基因组学的多模态基础模型发展,通过自监督表示学习实现。联邦训练框架可能进一步在机构间增强泛化能力,同时保护患者隐私。未来的IRPMs应包括伦理框架(如JustEFAB[22]、美国食品药品监督管理局(FDA)和加拿大卫生部的指南)以指导部署。重要的是,未来的系统应优先考虑因果稳健性、公平性审计和前瞻性验证,以确保现实世界的临床可靠性。最重要的是,未来的IRPMs应结合预测准确性与解释稳定性、公平性和临床可用性,完全符合TRIPOD + AI的开放科学精神。IRPMs研究在不断发展标准中弥合了方法学严谨性与可解释性。明确了范围和预期成果。2. 注册方案和元数据数据集DOI(如OSF、Zenodo)。确保研究材料的可查找性和可追溯性。3. 指定数据来源(如MIMIC-IV或机构数据集)及访问链接。允许数据验证和重用。4. 描述数据分割(训练/验证/测试)和样本量。防止数据泄露和偏差。5. 列出所有使用的变量、定义、单位和缺失数据处理方法。支持数据重建和一致性。特征选择和预处理6. 提供特征选择方法的代码(如LASSO、Boruta、SVM-RFE)。重现变量选择步骤。7. 报告所用软件版本和库(如R 4.4.2、Python 3.9、scikit-learn 1.6.1)。确保计算兼容性。模型开发8. 指定每种算法的模型类型和超参数。使模型训练能够完全复制。9. 提供随机种子和交叉验证详情(k折数、分层规则)。保证各次运行结果一致。10. 发布计算AUC、AUPRC、F1、校准、DCA和CIC的脚本。验证报告的性能指标。11. 包含自助法或交叉验证统计量(≥1,000次重采样)。量化统计不确定性。12. 分享用于SHAP、LIME或PDP可视化和亚组公平性分析的代码。重现可解释性输出。
Keyword:
risk prediction model,fair principles,clinical data,explainable artificial intelligence (XAI),interpretable machine learning

期刊

Frontiers in Bioinformatics 封面图
Frontiers in Bioinformatics
IF:
3.9
论文数:
415
被引数:
1.0K

机构

暂无机构信息