arrow
返回

A Fast Parallel Random Forest Algorithm Based on Spark

delete2023-05-17
delete0
delete
OA
AI
DOI:10.3390/app13106121delete
delete原文链接
delete原文求助
delete分享
delete收藏
摘要

摘要

En 中文
为提高大数据环境下的计算效率与分类精度,基于Spark计算框架提出了一种优化的并行随机森林算法。首先,定义了一种新的基尼系数以降低特征冗余对分类精度的影响;其次,为减少连续特征候选分裂点数量及基尼系数计算量,提出了一种近似等频分箱方法以高效确定最优分裂点;最后,基于Apache Spark计算框架,定义了森林采样索引(FSI)表,以加速决策树的并行训练过程并降低数据通信开销。实验结果表明,所提算法在保证分类精度的同时提升了随机森林的构建效率,且在性能与可扩展性方面优于Spark-MLRF。

期刊

暂无期刊信息

机构

暂无机构信息
引用论文

引用论文

暂无论文信息