Advertisement

西瓜书机器学习(第四章):决策树笔记

阅读量:

1.什么是决策树?

决策树作为机器学习中较为典型的一种技术手段,以二分类任务为例,其运行机制是通过多个层级的子决策来判定样本是否属于正类。在判断过程中,系统会选取某一特征作为判断依据。以西瓜分类问题为例,假设已经构建完成相应的模型。当面对一个西瓜样本时,首先观察其色泽属性,若呈现为青绿色,则依照该特征继续向下推进判断流程,最终得出该西瓜是否属于正例(即好瓜)的结论。

在这里插入图片描述

2. 三种选择最优化分属性的方法

在了解了决策树的运行机制之后,接下来需要明确的是,如何确定每个分支节点所依赖的属性。此时,“纯度”这一概念能够为我们提供有效的解决思路。理想情况下,决策树的每一个分支节点所包含的样本应尽可能归属于同一类别,因此提升样本集合的纯度成为关键目标。

2.1 信息增益(越大越好)

信息增益的计算公式为信息熵减去条件熵。

条件熵用于衡量在样本属性a取值已知的情况下,样本集合的纯度。其中,j表示属性a所对应的第j个取值。

![图一](https://ad.itadn.com/c/weblog/blog-img/images/2025-05-3

全部评论 (0)

还没有任何评论哟~