返回
Prediction of Enzyme function using interpretable optimized Ensemble learning framework
DOI:10.1039/D5SC04513D.png)
摘要
En 中文
准确预测酶的功能,特别是对于新发现的未表征序列,对现代生物学研究至关重要。最近,基于机器学习(ML)的方法显示出前景。然而,这些工具通常在特征提取、可解释性和泛化能力方面存在复杂性。在本研究中,我们构建了酶功能数据集,并提出了一种可解释的机器学习方法SOLVE(Soft-Voting Optimized Learning for Versatile Enzymes),该方法通过仅使用来自蛋白质一级序列的分词子序列组合进行分类,解决了这些问题。SOLVE利用集成学习框架,整合了随机森林(RF)、轻量级梯度提升机(LightGBM)和决策树(DT)模型,并采用优化的加权策略,以提高预测精度,区分酶与非酶,并预测单功能和多功能酶的酶学委员会(EC)编号。SOLVE中的焦点损失惩罚有效缓解了类别不平衡问题,提高了功能注释的准确性。此外,SOLVE通过Shapley分析提供可解释性,识别酶的催化位点和别构位点上的功能基序。通过仅利用一级序列数据,SOLVE简化了功能未表征序列的高通量酶功能预测,并在独立数据集的所有评估指标上优于现有工具。凭借高预测精度及其识别功能区域的能力,SOLVE有望成为生物学不同领域和药物治疗设计中的一个有前景的工具。
Keyword:
enzyme function prediction
machine learning
interpretable models
enzyme commission (EC) numbers
class imbalance mitigation
AI总结
对已上传原文的论文进行重点信息的提取,主要内容包括:简要概述、研究摘要、背景介绍、关键亮点、图文解析、展望与总结。
期刊
IF:
7.4
论文数:
1.7W
被引数:
9.3W
机构
暂无机构信息
引用论文
COFACTOR: improved protein function prediction by combining structure, sequence and protein-protein interaction information
NUCLEIC ACIDS RESEARCH
IF13.1

