Advertisement

分类器集成方法Bootstrap, Boosting, Bagging, 随机森林(二)

阅读量:

**接《分类器组合方法Bootstrap, Boosting, Bagging, 随机森林(一) 》
**

Adaboost

Adaboost为每一个基础分类器分配了一个权重系数α,该权重系数α与训练过程中的误差率存在函数关系。当错误率趋近于1时,对应的α值将呈现出较大的负数特征;相反,若错误率接近于0,则α值会表现为较大的正数。随后,依据这些α值对训练样本的权重进行调整与更新。

权值更新公式的作用在于提升那些被误判样本的权重,同时降低已被正确分类样本的权重。

在早期的Bagging算法中,最终的预测结果是通过多个基分类器的预测结果进行投票决定的,但Adaboost并非采用这种方式,而是依据基分类器所对应的权重参数α来得出最终结果,这种机制有助于对那些表现较差的模型施加更大的惩罚。

此外,若在任意一轮迭代过程中误差率超过50%,则所有样本的权重将被统一重置为初始值1/N,并重新进行抽样操作。

算法执行流程如下:

例如,仍以此前的情形为例,假设有10个样本数据,每个样本对应一个属性数值。

随机森林模型应用与分析

RF 是一种基于决策树分类器构建的集成学习方法。具体而言,在这种集成框架中,所采用的基础分类模型固定为决策树结构。在每棵决策树的生成过程中,所使用的属性集合均为原始数据属性的一个随机抽样子集。此前已介绍过决策树的相关内容,以 ID3 算法为例,其节点划分依据是选择信息增益最高的属性进行分割,而信息增益的计算则基于所有可用属性的综合评估,因此整棵树的生长依赖于全部属性的共同作用;然而在 RF 中,情况有所不同,每棵树的成长仅依赖于从整体属性中随机选取的一部分。

上述示意图展示了随机森林的工作机制。对于每一个测试样本而言,其最终分类结果是由各个基础分类器独立预测后通过多数表决的方式确定的。

全部评论 (0)

还没有任何评论哟~