返回
Optimizing sample size for supervised machine learning with bulk transcriptomic sequencing: a learning curve approach
DOI:10.1093/bib/bbaf097.png)
摘要
En 中文
利用转录组学数据进行准确的样本分类对于推动个性化医学至关重要。实现这一目标需要确定一个合适的样本量,以确保分类精度,同时避免不必要地分配过多资源。现有的样本量计算方法依赖的假设和算法可能与监督式机器学习技术不匹配。为解决这一关键的方法学差距,我们提出了一种新的计算方法,通过采用数据增强策略并结合学习曲线拟合,建立了准确率与样本量的关系。我们基于一系列评估指标,综合考虑了多种数据特征和算法配置,全面评估了该方法在miRNA和RNA测序数据上的性能。为促进易用性和可重复性,我们方法的Python和R实现代码已发布在GitHub上。该方法的部署将显著促进机器学习在转录组学研究中的应用,并加速其转化为用于个性化治疗的临床实用分类器。
Keyword:
sample size
machine learning
transcriptomics
bulk sequencing
期刊
IF:
7.7
论文数:
5.8K
被引数:
2.7W
机构
引用论文
How large a training set is needed to develop a classifier for microarray data?
CLINICAL CANCER RESEARCH
IF10.2

