Advertisement

机器学习算法:手动搭建决策树分类器(代码和图表)

阅读量:

决策树分类器应用实践

  • 基于CART算法的决策树分类机制
    • 分类模型的构建过程
    • 采用鸢尾花数据集进行验证测试

决策树分类器原理(CART)

CART属于决策树分类器的一种类型,其显著特点在于既适用于分类任务,也适用于回归任务,具体应用哪种任务取决于所关注的变量是类别型还是连续型。
分裂属性的选择标准:
与ID3和C4.5相比,CART在评估标准的选择上存在差异。ID3采用信息增益作为衡量数据纯度的指标,而C4.5则使用信息增益比,CART则分别采用基尼系数(用于分类)和均方差(用于回归)。对于回归问题而言,传统的信息熵度量方式并非最优选择(相较于最小均方差),但在分类问题中为何选择基尼系数替代信息增益比呢?实际上这是为了降低计算复杂性。熵模型涉及对数运算,而基尼系数则为二次运算;同时基尼系数与熵的一半曲线非常接近,因此可以作为计算成本更低的替代方案。
离散属性的分裂方式:
由于CART生成的决策树为二叉树结构,因此会将该属性下的所有离散值划分为两组,并在所有可能的分组方案中找出使基尼系数最小的那一组。
连续属性的分裂方式:
CART对连续型属性的处理方法与C4.5类似,即将数据集中出现的所有数值视为一个类别,并按照数值大小进行分割。最终根据均方差最小原则确定最佳分割点。
*剪枝的标准:

全部评论 (0)

还没有任何评论哟~