机器学习决策树和随机森林代码示例(Python版)
发布时间
阅读量:
阅读量
一、决策树
决策树学习属于机器学习中广泛应用的一类算法。在构建的决策树结构中,根节点涵盖了全部的样本数据。每一个非叶子节点代表对样本数据的一种划分方式,通常与某个特定属性相关联,该属性能够将样本分布至不同的子节点之中。而每个叶子节点则对应最终的决策结果。由此可知,从根节点延伸至各个叶子节点的路径实际上构成了一个完整的判断流程。
可与下图做比对:

在上述决策树结构中,用于划分的属性包括年龄、是否为学生以及信用率。划分属性通常基于样本的某一特征或多个特征的组合形式进行选择。决策树的学习过程属于有监督学习范畴,其以样本数据为基础,采用自顶向下的递归方式对样本实施划分。该方法的核心理念是通过信息熵作为衡量标准,构建出能够使熵值下降速度最快的树形结构,直至最终的叶子节点所对应的熵值达到零。
二、信息熵
概念界定与定义
“信息熵”作为衡量样本集合纯度的常用量化标准,被广泛应用于相关分析中。若当前样本集合D包含k类样本(对应k种不同的标签类别),且第i类样本在整体集合中所占比例为pi(i = 1,2,…,k),则可将该样本集合D的信息熵表述
全部评论 (0)
还没有任何评论哟~
