返回
Benchmarking generative models for COI DNA barcoding
DOI:10.1038/s41598-026-63888-z.png)
摘要
En 中文
细胞色素c氧化酶亚基I(COI)DNA条形码被广泛用于物种鉴定和生物多样性研究。然而,COI数据集表现出高种内相似性和显著的种间不平衡,这限制了序列分析。为解决数据稀缺问题,基于深度学习的生成模型已被探索用于序列生成。我们实现了六种生成模型,整合了门控循环单元(GRU)层、Transformer块和卷积层,以在四个分类群(Cypraeidae、Drosophila、Bats和Birds)中生成物种特异的COI序列。生成的序列在合理性、系统发育一致性和多样性方面进行了评估。最终,基于GRU的自回归语言模型表现最佳。它保留了与真实数据相同的密码子级结构,GC₃含量差异(Δ)≤ 0.004,密码子偏差JSD ≤ 0.013,ORF平均长度差异(Δ)< 0.05。它还再现了遗传结构,种内K2P平均差异(Δ)≤ 0.13,真实-合成K2P平均 ≤ 0.09,条形码间隙率差异(Δ)≤ -0.6。此外,它生成的序列冗余最小,表现为JSD-kmer ≤ 0.03,Self-BLEU差异(Δ)≤ 0.001,AA值在0.54到0.75之间。这些结果表明,基于GRU的COI序列生成可以作为解决生物信息学应用中数据稀缺和不平衡问题的稳健模拟策略。
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
3.9
论文数:
28.0W
被引数:
83.5W
机构
引用论文
Deep convolutional and conditional neural networks for large-scale genomic data generation
plos biology
IF3.6
Automatic Chemical Design Using a Data-Driven Continuous Representation of Molecules使用数据驱动的分子连续表示的自动化学设计
ACS CENTRAL SCIENCE
IF10.4
MAFFT Multiple Sequence Alignment Software Version 7: Improvements in Performance and UsabilityMAFFT多序列比对软件版本7: 性能和可用性的改进
Ensemble feature selection and tabular data augmentation with generative adversarial networks to enhance cutaneous melanoma identification and interpretability集成特征选择和生成对抗网络的表格数据增强,以增强皮肤黑色素瘤的识别和可解释性
BIODATA MINING
IF6.1
MAFFT: a novel method for rapid multiple sequence alignment based on fast Fourier transformMAFFT: 一种基于快速傅里叶变换的快速多序列比对方法
NUCLEIC ACIDS RESEARCH
IF13.1

