随机的森林模型 随机的森林模型
发布时间
阅读量:
阅读量
Part I: 集成学习简述
集成学习(ensemble learning)通过构建并融合多个学习模型来实现对学习任务的处理。在集成学习框架下,当参与集成的个体分类器数量逐步增加时,整体系统的错误率会呈现出指数级的下降趋势,并最终趋于零。这一现象基于一个核心前提条件:基础学习器所产生的误差之间具备相互独立性。
依据个体学习器的生成机制,当前主流的集成学习策略主要划分为以下两类:
- 个体学习器之间具有较强的依赖关系,需按照特定顺序依次生成的序列化方法,其典型代表为Boosting;
- 个体学习器之间不存在显著依赖关系,能够并行生成的并行化方法,其典型代表包括Bagging以及随机森林(Random Forest)。
Part II: Bagging
Bagging 的基本流程:
对于包含m个样本的数据集合,首先随机选取一个样本纳入采样集合中,随后将其重新放回原始数据集,以确保在后续采样过程中该样本仍具有被再次选中的可能性。通过进行m次此类有放回的抽样操作后,原始训练集中大约有63.2%的样本会被纳入到采样集合中。
按照上述方式,我们可以生成T个各自包含m个训练样本的采样集合,并基于每个采样集合分别训练出一个基础学习模型,最终将这些基础学习模型进行集成处理。这一过程即为Bagging方法的基本实现步骤。
Bagging
全部评论 (0)
还没有任何评论哟~
