返回
A deep learning–based score to evaluate multiple sequence alignments
DOI:10.1093/molbev/msag173.png)
摘要
En 中文
多重序列比对(MSA)推断是分子进化和比较基因组学的核心任务,下游分析(包括系统发育推断)的可靠性严重依赖于比对质量。尽管其重要性,大多数广泛使用的MSA方法优化的是成对和(SoP)得分,而相对较少关注该目标函数是否准确反映比对准确性。在此,我们使用模拟和经验基准比对评估SoP得分的表现。对于每个数据集,我们比较由相同未比对序列产生的替代MSA,并量化其SoP得分与参考比对距离之间的关系。我们证明具有最优SoP得分的比对通常不对应最准确的比对。为解决此局限性,我们开发了基于深度学习的评分函数,整合了一组MSA特征。我们首先介绍模型1,一种回归模型,用于预测给定MSA与参考比对的距离。在模拟和经验数据集中,该学习得分与真实比对准确性的相关性强于SoP得分。然而,模型1在识别替代比对中的最佳比对方面效果较差。因此,我们开发了模型2,它以同一序列生成的若干替代MSA为输入,预测其相对排名。模型2比SoP得分、模型1和几种广泛使用的比对程序更准确地识别排名最高的MSA。通过模拟,我们证明基于我们方法选择MSA可导致更准确的系统发育重建。
期刊
IF:
5.3
论文数:
8.4K
被引数:
6.6W
机构
引用论文
OrthoMaM v12: a database of curated single-copy ortholog alignments and trees to study mammalian evolutionary genomics
NUCLEIC ACIDS RESEARCH
IF13.1
Comparing different machine learning and mathematical regression models to evaluate multiple sequence alignments比较不同的机器学习和数学回归模型以评估多序列比对
NEUROCOMPUTING
IF6.5

