返回
Optimizing Model Performance and Interpretability: Application to Biological Data Classification
DOI:10.3390/genes16030297.png)
摘要
En 中文
本研究引入了一种新颖的框架,能够同时解决基于转录组数据的分类中性能准确性和结果可解释性的挑战。背景/目标:在生物数据分类中,同时实现高性能准确性和可解释性是一项挑战。本研究提出了一种框架来解决基于转录组数据的分类中的这两项挑战。其目标是通过选择特征、模型以及一个优化分类性能和可解释性的元投票分类器。方法:该框架包含一个四步特征选择过程:(1) 识别其酶基因表达能够区分不同标签样本的代谢通路,以增强可解释性;(2) 选择那些基因表达矩阵的第一主成分能够大幅捕捉其表达方差的通路;(3) 选择最小基因集合,其整体区分能力覆盖通路基区分能力的95%;(4) 引入对抗样本以识别并过滤对这类样本敏感的基因。此外,对抗样本还被用于选择最优分类模型,并基于优化模型的结果构建元投票分类器。结果:该框架应用于两个癌症分类问题,显示在二分类中,预测性能与全基因模型相当,F1得分差异在-5%至5%之间;在三分类中,性能显著更好,F1得分差异在-2%至12%之间,同时保持了所选特征基因的优异可解释性。结论:该框架有效整合了特征选择、对抗样本处理和模型优化,为广泛的生物数据分类问题提供了有价值的工具。其平衡性能准确性和高可解释性的能力使其在计算生物学领域具有高度适用性。
Keyword:
feature gene selection
model selection
machine learning
interpretability
期刊
IF:
2.8
论文数:
2.8K
被引数:
3.5W
机构
暂无机构信息
引用论文
Interpretable machine learning: Fundamental principles and 10 grand challenges可解释的机器学习: 基本原则和十大挑战
STATISTICS SURVEYS
IF15.4
GENCODE: The reference human genome annotation for The ENCODE ProjectGENCODE: ENCODE项目的参考人类基因组注释
GENOME RESEARCH
IF5.5
Feature clustering based support vector machine recursive feature elimination for gene selection基于特征聚类的支持向量机递归特征消除基因选择
APPLIED INTELLIGENCE
IF3.5
GAMI-Net: An explainable neural network based on generalized additive models with structured interactionsGami-net: 基于具有结构化交互作用的广义加性模型的可解释神经网络
PATTERN RECOGNITION
IF7.6
Quantifying synergistic interactions: a meta-analysis of joint effects of chemical and parasitic stressors
SCIENTIFIC REPORTS
IF3.9

