决策树用于分类与回归
发布时间
阅读量:
阅读量
决策树算法的大概流程
为了构建决策树模型,在给定的数据集上进行特征空间划分是一个关键步骤。该模型通过递归分割数据集形成层次化的分支结构,在每一个分支节点上依据特定特征对数据进行筛选与划分,在此过程中生成一系列条件判断路径最终分类结果则由叶子节点给出如图所示

步骤1:在每个节点上选择最佳分支特征。确定最佳特征的方式多种多样,并以信息增益法最为常见。
步骤2:将当前节点的训练样本集合基于最优分叉的属性值划分为若干个子集,并将其各自作为下一个节点。
举个例子:如果步骤1告诉我们,在决策树算法中当前节点的最优属性被确定为"纹理"特征,并且其取值为三个层次:清晰、稍糊和模糊。那么我们需要将训练集划分为三组子节点分别对应这三个层次的取值情况。而对于那些最优属性具有连续数值的情形,则通常采用二分法策略——即寻找一个合适的阈值(可以是中位数或其他统计量),将数据集划分为两类:一类是该阈值以上的样本集合;另一类则是该阈值以下的样本集合。

还没有任何评论哟~
