Advertisement

数据分析实践 — 随机森林 — 信用卡违约率分析

阅读量:

文章结构概述

    • 数据挖掘关键议题:
      • 本次数据挖掘学习重点:
      • 随机森林算法
      • 借助Pipeline管道机制实现流程化操作
      • 实例:信用卡违约概率的分析:
      • 应用Adaboost方法所获得的分类精确度:

数据挖掘核心问题解析

1、各类分类器的选择策略;
2、对分类器参数进行优化调整,以提升分类结果的精确度。

本次数据挖掘学习目标:

  • 构建多种分类模型,涵盖已熟悉的 SVM、决策树、KNN 分类方法,以及随机森林分类模型;(选择分类器)
    • 熟练运用 GridSearchCV 工具,对算法模型的参数进行调优;(参数优化)
    • 利用 Pipeline 管道机制实现流程化操作。由于在执行分类任务之前,通常需要完成若干预处理步骤,例如数据标准化或特征维度缩减等。(数据规范化)

随机森林

Random Forest 是随机森林的英文名称,其对应的英文缩写为 RF。该模型本质上是由多个决策树组成的分类工具,其中每一个子分类单元均为一棵 CART 分类回归树。因此,随机森林既适用于分类任务,也适用于回归任务。
在进行分类操作时,其输出结果为所有子分类器所给出的各类别中出现频率最高的类别。可以将其视为每个分类器对结果进行投票,最终选择获得票数最多的类别作为输出。

全部评论 (0)

还没有任何评论哟~