西瓜书机器学习(第四章):决策树笔记
发布时间
阅读量:
阅读量
1.什么是决策树?
决策树作为机器学习中较为典型的一种技术手段,以二分类任务为例,其运行机制是通过多个层级的子决策来判定样本是否属于正类。在判断过程中,系统会选取某一特征作为判断依据。以西瓜分类问题为例,假设已经构建完成相应的模型。当面对一个西瓜样本时,首先观察其色泽属性,若呈现为青绿色,则依照该特征继续向下推进判断流程,最终得出该西瓜是否属于正例(即好瓜)的结论。

2. 三种选择最优化分属性的方法
在了解了决策树的运行机制之后,接下来需要明确的是,如何确定每个分支节点所依赖的属性。此时,“纯度”这一概念能够为我们提供有效的解决思路。理想情况下,决策树的每一个分支节点所包含的样本应尽可能归属于同一类别,因此提升样本集合的纯度成为关键目标。
2.1 信息增益(越大越好)
信息增益的计算公式为信息熵减去条件熵。
条件熵用于衡量在样本属性a取值已知的情况下,样本集合的纯度。其中,j表示属性a所对应的第j个取值。

还没有任何评论哟~
