Advertisement

探索型证伪第(二)小结---R语言分类案例实战及分箱方法比较

阅读量:

R的阶段性复习小结–决策树

1、决策树知识点

算法特点:

优点:计算复杂度较低,在输出结果上较为直观易懂;对于中间值的缺失具有一定的鲁棒性,并且能够有效处理与输入特征之间存在一定关联关系的变量;特别适用于需要通过初步数据分析来探索潜在模式和关系的情景。缺点:存在过度拟合的风险。决策树算法在实际应用中并不需要采用特征归一化处理;不同类型的熵函数对决策树的构建产生的影响相对较小。建议优先采用二叉树结构,并且应避免在单个节点处出现较大的熵变化以降低模型过拟合的可能性

算法 分类标准 程序包 函数 特点
ID3算法 选择信息增益最高的属性作为最优划分属性 rpart包 rpart函数(prune修剪) 只支持分类变量可为多叉树
C4.5算法 选择信息增益率最高的属性最优划分属性 RWeka包 J48函数 C4.5应用于大数据集
C5.0算法 C4.5改进 C50包 C5.0函数 只支持分类变量
CART算法 选择基尼指数最小的属性作为最优划分属性 tree包, rpart包 tree函数, rpart函数(prune修剪) 支持分类、连续型变量,只能是二叉树
条件推断树算法 显著性检验 ctree函数 party包 只支持分类变量
建立树模型要权衡两方

全部评论 (0)

还没有任何评论哟~