决策树学习小结
发布时间
阅读量:
阅读量
决策树
决策树(Decision Tree)是一种基于各类情形发生概率的分析方法,通过构建决策树模型来计算净现值期望值不低于零的概率,从而对项目风险进行评估并判断其可行性。该方法以直观的图解形式应用概率分析,有助于清晰展示决策过程。(概念摘自百度百科)
特征选择
本部分首先对信息熵以及信息增益的概念进行介绍
信息熵(information entropy)
在信息论及概率论领域,熵(entropy)被用作衡量随机变量不确定性程度的指标,事物的不确定性越高,其对应的熵值也就越大。因此,信息熵成为评估样本集合纯度最为常见的一项标准。
假设当前集合D中第k类样本所占的比例为p_i(i=1,2,3,...),那么D的信息熵可表示为
若 H(D) 的数值越低,则 x 的纯度相应地越高
条件熵
条件熵与条件概率具有相似性,它用于在特定条件下衡量随机变量所蕴含的不确定性程度。
信息增益(Kullback–Leibler divergence)
信息增益 = 熵 - 条件熵
用于描述在特定条件下,信息不确定性的降低幅度。
通常而言,当 $
全部评论 (0)
还没有任何评论哟~
