集成模型思想篇:从Bagging到随机森林(RF),从提升方法到Adaboost、梯度提升树(GBDT)→xgboost→lightgbm;逐步理解和记忆
发布时间
阅读量:
阅读量
集成学习模型思想与对比总结
集成模型的核心理念在于,认为单一机器学习器在学习方向与学习范围等方面的能力存在局限性。为提升整体的学习效能,可通过将多个相同学习器对同一数据集进行训练后所得结果进行加权平均,从而形成最终的输出结果。这一结果融合了各个学习器的优势,实现互补与制约,在增强整体学习能力的同时,有效规避了单个学习器可能因偏差过大而带来的负面影响。
这种思路类似于在竞赛中邀请多位评委对同一参赛者进行评分,并通过计算平均分来确定最终成绩。
集成模型主要包含两种不同的实现方式,分别被称作 bagging 与 boosting,以下将详细阐述这两种方法的构建原理及其特性。
一、Bagging与Boosting方法对比
bagging
在bagging方法中,所有基础学习模型在训练过程中彼此独立,互不干扰,各自完成自身的学习任务。待所有基础模型训练完成后,再对它们的输出结果进行加权平均处理。这种机制可以类比为一个团队参与创作比赛时的情形:每位成员各自独立完成作品,在提交前将所有作品集中讨论,结合每个人的优势,最终形成一个综合性的成果。
bagging方法中最典型的代表模型就是随机森林(Random Forest),通常简称为RF
boosting
在这一集成策略中,各个基础学习器之间存在一定的依赖关系。具体而言,
全部评论 (0)
还没有任何评论哟~
