返回
摘要
En 中文
为提高大数据环境下的计算效率与分类精度,基于Spark计算框架提出了一种优化的并行随机森林算法。首先,定义了一种新的基尼系数以降低特征冗余对分类精度的影响;其次,为减少连续特征候选分裂点数量及基尼系数计算量,提出了一种近似等频分箱方法以高效确定最优分裂点;最后,基于Apache Spark计算框架,定义了森林采样索引(FSI)表,以加速决策树的并行训练过程并降低数据通信开销。实验结果表明,所提算法在保证分类精度的同时提升了随机森林的构建效率,且在性能与可扩展性方面优于Spark-MLRF。
期刊
暂无期刊信息
机构
暂无机构信息
引用论文
暂无论文信息

