Advertisement

分类变量水平压缩(一)

阅读量:

分类变量的水平一定要压缩

模型中分类变量一般需要处理成0-1形式的哑变量。

当自变量的类别数量较多时(即自变量的取值范围非常广),其对应的虚拟变量数目也会显著增加(即每个类别都需要一个哑变量来表示),在这样的情况下构建模型显然不可行(因为这会导致多重共线性问题)。必须对分类自变量进行降维处理(比如合并同类类别或使用正则化方法)。

分类变量水平压缩的方法

通常情况下,在处理分类变量时进行水平压缩有两种常用方法。本文将先谈谈我对哑变量编码法的理解。

  • 哑变量编码法

基于目标变量的WOE 转换法;

我眼中的 哑变量编码法

当输入特征具有多个分类时,在应用多元回归模型时,在应用多元回归模型时

例如某个分类变量具有多个数值类型共有19种不同的取值情况那么我们可以采用数据压缩的方法将这些数值类型减少至仅包含5种主要类别在此基础上建立相应的基底变量共包含4个这样的虚拟指标这样一来整个操作流程变得更加简洁明了对于这类问题在实际操作中我会优先考虑采用决策树模型来进行建模分析

在构建逻辑回归模型时,在生成预测概率的过程中,默认情况下系统会自动创建n-1个虚拟变数。与此同时,在传统线性回归分析中则需要自行创建这些虚拟变数才能纳入分析过程。相比之下,在构建预测概率的过程中,默认情况下生

全部评论 (0)

还没有任何评论哟~