arrow
返回

Autoencoders for genomic variation analysis

delete2026-02-01
delete1
PRE
AI
M
Margarita Geleta *
D
Daniel Mas Montserrat
X
Xavier Giró-i-Nieto
A
Alexander G. Ioannidis
DOI:10.1101/gr.280086.124delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
现代生物样本库正提供大量不同人群的高分辨率基因组序列。为适应多样化和混血人群,需要新的算法工具来准确捕捉人群的遗传组成。本研究探索了深度学习技术,特别是变分自编码器(VAEs),从人群视角处理基因组数据。我们利用来自人类和犬科动物的全球全基因组数据集,展示了VAEs在基因组数据的解释、压缩、分类和模拟等任务中的强大能力,并评估了有和无谱系条件下的应用性能。自编码器的无监督设置允许检测和学习精细的人群结构,并推断信息丰富的潜在因子。VAEs学习的潜在空间能够捕捉和表示单核苷酸多态性(SNPs)上相似遗传组成的样本的差异化高斯状集群,实现降维和数据模拟应用。这些个体基因型序列可分解为潜在表示和重建误差(残差),提供适用于无损压缩的稀疏表示。我们发现不同人群具有差异化的压缩率和分类准确率。此外,我们分析了SNP数据的熵、其对跨人群压缩的影响及其与历史迁徙的关系,并展示了如何将自编码器引入现有压缩流程。
Keyword:
LOCAL-ANCESTRY INFERENCE
GENETIC ANCESTRY
DATA-COMPRESSION

期刊

Genome Research 封面图
Genome Research
IF:
5.5
论文数:
5.6K
被引数:
4.3W

机构

S
stanford university
学者数:
1.1W
论文数: 4.3K
被引数: 0
U
universitat politecnica de catalunya
学者数:
1.9W
论文数: 1.6W
被引数: 17
引用论文

引用论文

暂无论文信息