返回
Machine learning improves SNP microarray performance in challenged samples
DOI:10.1093/bioadv/vbag086.png)
摘要
En 中文
SNP微阵列提供了一种成本效益高的基因分型方法,应用于各种科学学科。样本成本从几十到几百美元不等,存储成本相对合理,分析方法易于扩展到大样本量。然而,微阵列设计用于高质量样本,而非低量DNA输入。为应对此问题,处理挑战性样本时必须正确考虑不确定性。当数据不确定时,与其调用明确的基因型,不如以概率方式表示。这种方法既能无缝对接直接考虑可能性的工具,又能通过移除不确定的基因型调用,与期望硬调用的工具保持兼容。本研究使用了多种机器学习算法,以估算从Illumina Omni5-4微阵列数据生成的基因型和基因型可能性,并比较了结果。虽然神经网络和XGBoost均表现良好,但XGBoost似乎在Omni5-4芯片生成的样本类型中具有更好的泛化能力(不同技术间的泛化有待进一步检验)。此外,它还能更直接地生成基因型质量估计(而非评分),这一功能在微阵列分析中一直缺失。
Keyword:
GENOME
ASSOCIATION
期刊
B
IF:
2.8
论文数:
131
被引数:
0
机构
暂无机构信息
引用论文
A universal SNP and small-indel variant caller using deep neural networks使用深度神经网络的通用SNP和小indel变体调用器
NATURE BIOTECHNOLOGY
IF41.7
Inferring Population Structure and Admixture Proportions in Low-Depth NGS Data在低深度NGS数据中推断种群结构和混合比例
GENETICS
IF5.1
Extremely low-coverage sequencing and imputation increases power for genome-wide association studies
NATURE GENETICS
IF31.8
Variance stabilization applied to microarray data calibration
and to the quantification of differential expression方差稳定在微阵列数据校准中的应用
以及差异表达的量化
Impact of SNP microarray analysis of compromised DNA on kinship classification success in the context of investigative genetic genealogy在研究性遗传谱系的背景下,受损DNA的SNP微阵列分析对亲属分类成功的影响

