Advertisement

决策树学习小结

阅读量:

决策树

决策树(Decision Tree)是一种基于各类情形发生概率的分析方法,通过构建决策树模型来计算净现值期望值不低于零的概率,从而对项目风险进行评估并判断其可行性。该方法以直观的图解形式应用概率分析,有助于清晰展示决策过程。(概念摘自百度百科

特征选择

本部分首先对信息熵以及信息增益的概念进行介绍

信息熵(information entropy)

在信息论及概率论领域,熵(entropy)被用作衡量随机变量不确定性程度的指标,事物的不确定性越高,其对应的熵值也就越大。因此,信息熵成为评估样本集合纯度最为常见的一项标准。
假设当前集合D中第k类样本所占的比例为p_i(i=1,2,3,...),那么D的信息熵可表示为

H(D) 的数值越低,则 x 的纯度相应地越高

条件熵

条件熵与条件概率具有相似性,它用于在特定条件下衡量随机变量所蕴含的不确定性程度。

信息增益(Kullback–Leibler divergence)

信息增益 = 熵 - 条件熵
用于描述在特定条件下,信息不确定性的降低幅度。

通常而言,当 $

全部评论 (0)

还没有任何评论哟~