Advertisement

机器学习核心随机森林模型

阅读量:

引入

在回顾先前所学的两种算法时,可以发现Bagging算法通过bootstrapping方法获取差异化的数据集,将这些数据输入到基础算法中,从而生成多个模型g,最终通过对这些模型的结果进行平均处理,得到综合的预测结果G;而在决策树算法中,则是采用递归方式构建子树,最终形成一棵完整的决策树。
这两种算法各自具备独特的特性,其中决策树对数据的变化较为敏感,其算法方差较大;而Bagging则通过投票与平均的方式有效降低了模型的方差。若将这两种方法融合应用,便形成了本文即将介绍的随机森林方法,即random forest。

1. 随机森林算法

随机森林算法中所指的“随机”特性,源于Bagging方法中通过bootstrapping技术获取的多样化数据集,这种数据差异性体现了算法的随机特征。随后,这些数据被输入至CART算法进行训练,生成单棵决策树,最终通过对所有生成树的结果进行综合平均,从而得出最终预测结果。

并行计算的可能性: 随机森林算法在Bagging阶段具备良好的并行计算潜力,可以将不同的计算任务分配至多台计算机上执行。每台设备能够独立完成一棵树的学习过程,且各棵树之间不存在相

全部评论 (0)

还没有任何评论哟~