返回
Gradient responsive regularization: a deep learning framework for codon frequency based classification of evolutionarily conserved genes
DOI:10.1186/s12863-025-01358-7.png)
摘要
En 中文
背景 在小麦 (Triticum aestivum)、水稻 (Oryza sativa)、大麦 (Hordeum vulgare) 和短柄草 (Brachypodium distachyon) (BD) 等主要作物中识别保守基因,对于理解共享的进化特征和提高农业生产力至关重要。传统生物信息学工具,如 BLAST,有助于检测序列相似性,但在有效处理大规模基因组数据方面往往存在不足。深度学习的最新进展,特别是多层感知器 (MLPs),为揭示复杂的基因组模式提供了强大的替代方案。然而,优化这些模型需要先进的正则化方法来确保可靠性。将生物信息学与自适应深度学习技术相结合,为揭示保守基因并加深对植物基因组进化和功能的理解提供了一种稳健的方法。本研究通过整合生物信息学和深度学习来识别进化上保守的基因,解决了小麦、水稻、大麦和 BD 四个农业重要物种间的基因组保守性。
结果 四个物种的全基因组数据从 Ensembl 下载(253,076 个基因)。通过 BLASTn 进行的双向最佳命中 (RBH) 将数据集缩减至 25,152 个高度相似的序列,突显了四个物种间的共同祖先。一种新型的多层感知器 (MLP) 框架,经梯度响应正则化 (GRR) 增强,与使用学习率 (0.01、0.001、0.0001) 和批量大小 (16、32、64、128) 的 MLP 惩罚变体(L1、L2、弹性网络、自适应)进行了基准测试。所有模型在准确率、精确率、召回率、F1 分数和马修斯相关系数 (MCC) 方面均达到 > 99%,新型 GRR 表现相当,例如基于所有基因(完整数据)的学习率 (LR) = 0.0001 时准确率为 0.9992。
结论 新型梯度响应正则化 (GRR) 框架在所有评估指标(准确率、精确率、召回率、F1 分数和 MCC)上实现了最先进的性能。具体而言,在学习率为 0.0001 时,新型 GRR 在更大的批量大小(128 和 256)下对 RBH 过滤的数据集(25152 个基因)达到峰值性能,同时在批量大小为 32 时对完整的基因组数据集(253076 个基因)展现出卓越的可扩展性。通过 Kruskal Wallis 检验 (p < 0.05) 进行的统计验证证实了该方法相较于传统正则化方法的显著优势。值得注意的是,新型 GRR 在训练、验证和测试的所有评估阶段均保持一致的优势,突显了其适用于特征精炼(RBH)和全基因组分析的稳健性。这些结果表明该方法能够适应不同的数据复杂性,为基因组预测和进化研究提供了一个强大的工具。
Keyword:
Genome
Reciprocal best hits
Multilayer perceptron
Gradient responsive regularization
Bio-informatics
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
B
IF:
2.5
论文数:
77
被引数:
0
机构
引用论文
Shifting the limits in wheat research and breeding using a fully annotated reference genome
Science
IF0
Machine learning classifiers predict key genomic and evolutionary traits across the kingdoms of life
SCIENTIFIC REPORTS
IF3.9
The Precision-Recall Plot Is More Informative than the ROC Plot When Evaluating Binary Classifiers on Imbalanced Datasets在不平衡数据集上评估二元分类器时,精确召回率图比ROC图更具信息性
PLOS ONE
IF0

