返回
Random Forest Adaptation for High-Dimensional Count Regression
DOI:10.3390/math13183041.png)
摘要
En 中文
高维计数数据的分析带来了一系列独特的挑战,包括过度离散、零膨胀以及传统广义线性模型和标准机器学习方法往往难以充分处理的复杂非线性关系。本研究引入并验证了一种专门为高维泊松和负二项回归开发的全新随机森林框架,旨在克服现有方法的局限性。通过全面的模拟实验和针对挪威母亲与儿童队列研究的真实基因组学应用,我们证明所提出的方法实现了更优的预测精度,表现为更低的均方根误差和偏差,并且关键性地产生了异常稳定且易于解释的特征选择。我们的理论及实证结果表明,这些针对分布优化的集成方法在平衡统计稳健性与生物可解释性方面,显著优于正则化似然技术和基于朴素变换的集成方法。本研究得出结论:所提出的框架提供了一种关键的方法论进展,为从基因组学到公共卫生等领域的复杂计数数据中提取有意义的见解,提供了一种强大且可靠的工具。
Keyword:
high-dimensional analysis
count regression
Random Forest
overdispersion
zero-inflation
genomic analysis
期刊
IF:
2.2
论文数:
3.1K
被引数:
3.6W
机构
暂无机构信息
引用论文
REGRESSION-ANALYSES OF COUNTS AND RATES - POISSON, OVERDISPERSED POISSON, AND NEGATIVE BINOMIAL MODELS
PSYCHOLOGICAL BULLETIN
IF19.8
Bayesian weighted random forest for classification of high-dimensional genomics data基于贝叶斯加权随机森林的高维基因组数据分类

