返回
Comparison of missing data handling methods for variant pathogenicity predictors
DOI:10.1093/nargab/lqaf133.png)
摘要
En 中文
现代临床遗传学检测利用下一代测序(NGS)方法对患者遗传变异进行全面分析。在数百万个变异中,必须准确且快速地识别与患者表型相关的临床相关变异。由于手动评估无法满足临床遗传检测的速度和数量要求,因此需要自动化解决方案。已开发出多种机器学习(ML)、人工智能(AI)和计算机模拟变异致病性预测器来解决这一挑战。这些解决方案依赖于全面的数据,但难以应对稀疏的遗传注释。因此,对缺失数据的谨慎处理是必要的,且所选方法可能对准确性、可靠性、速度以及相关的计算成本产生巨大影响。我们介绍了一个名为AMISS的开源框架,可用于在变异致病性预测的背景下评估处理缺失遗传变异数据的不同方法的性能。使用AMISS,我们评估了14种处理缺失值的方法。这些方法在精度、计算成本和其他属性方面的表现差异显著。总体而言,更简单的插补方法(尤其是均值插补)表现最佳。
Keyword:
CLINVAR PUBLIC ARCHIVE
IMPUTATION
DISEASE
IDENTIFICATION
ANNOTATIONS
PACKAGE
DBNSFP

