数据分析实践 — 随机森林 — 信用卡违约率分析
发布时间
阅读量:
阅读量
文章结构概述
-
- 数据挖掘关键议题:
- 本次数据挖掘学习重点:
- 随机森林算法
- 借助Pipeline管道机制实现流程化操作
- 实例:信用卡违约概率的分析:
- 应用Adaboost方法所获得的分类精确度:
- 数据挖掘关键议题:
数据挖掘核心问题解析
1、各类分类器的选择策略;
2、对分类器参数进行优化调整,以提升分类结果的精确度。
本次数据挖掘学习目标:
- 构建多种分类模型,涵盖已熟悉的 SVM、决策树、KNN 分类方法,以及随机森林分类模型;(选择分类器)
- 熟练运用 GridSearchCV 工具,对算法模型的参数进行调优;(参数优化)
- 利用 Pipeline 管道机制实现流程化操作。由于在执行分类任务之前,通常需要完成若干预处理步骤,例如数据标准化或特征维度缩减等。(数据规范化)
随机森林
Random Forest 是随机森林的英文名称,其对应的英文缩写为 RF。该模型本质上是由多个决策树组成的分类工具,其中每一个子分类单元均为一棵 CART 分类回归树。因此,随机森林既适用于分类任务,也适用于回归任务。
在进行分类操作时,其输出结果为所有子分类器所给出的各类别中出现频率最高的类别。可以将其视为每个分类器对结果进行投票,最终选择获得票数最多的类别作为输出。
全部评论 (0)
还没有任何评论哟~
