返回
Autoencoders for genomic variation analysis
DOI:10.1101/gr.280086.124.png)
摘要
En 中文
现代生物样本库正提供大量不同人群的高分辨率基因组序列。为适应多样化和混血人群,需要新的算法工具来准确捕捉人群的遗传组成。本研究探索了深度学习技术,特别是变分自编码器(VAEs),从人群视角处理基因组数据。我们利用来自人类和犬科动物的全球全基因组数据集,展示了VAEs在基因组数据的解释、压缩、分类和模拟等任务中的强大能力,并评估了有和无谱系条件下的应用性能。自编码器的无监督设置允许检测和学习精细的人群结构,并推断信息丰富的潜在因子。VAEs学习的潜在空间能够捕捉和表示单核苷酸多态性(SNPs)上相似遗传组成的样本的差异化高斯状集群,实现降维和数据模拟应用。这些个体基因型序列可分解为潜在表示和重建误差(残差),提供适用于无损压缩的稀疏表示。我们发现不同人群具有差异化的压缩率和分类准确率。此外,我们分析了SNP数据的熵、其对跨人群压缩的影响及其与历史迁徙的关系,并展示了如何将自编码器引入现有压缩流程。
Keyword:
LOCAL-ANCESTRY INFERENCE
GENETIC ANCESTRY
DATA-COMPRESSION
期刊
IF:
5.5
论文数:
5.6K
被引数:
4.3W
机构
引用论文
暂无论文信息

