Advertisement

随机森林(RF)算法的核心原理及其相关算法

阅读量:

1.前言

集成学习主要包含两大体系:其一是提升系别(Boosting),其核心特征是各弱学习器之间相互关联;另一为袋装体系(Bagging),其显著特点在于各弱学习器之间相互独立且能够并行训练。本文旨在总结袋装方法与随机森林算法的相关理论基础及其应用实践。

随机森林作为一种独具特色的算法,在集成学习领域独领风骚(分庭抗礼),尤其得益于其高效的并行训练能力,在当下面对海量数据时代更具吸引力。

2.bagging的原理

bagging集成学习方法可以利用下图说明:

观察上图可知,在Bagging算法中,默认假设弱学习器之间并无类似于Boosting那样的关联性。其核心特征在于"随机采样"这一过程。(Bootstrap)即从我们的训练集中有放回地抽取固定数量的样本,在此过程中将每次抽取后将样本放回至原始集合中以备下次抽取使用。换句话说,在每一次弱学习器的学习过程中都会经历这样的采样过程:我们从训练集中随机选取与训练集样本总数m相等数量的样本(允许重复选取同一实例),而这些被选中的实例组成了新的采样数据集。需要注意的是,在进行了T

全部评论 (0)

还没有任何评论哟~