特征工程中的特征选择(2) 特征工程中的特征选择(2)
发布时间
阅读量:
阅读量
文章目录
- 问题提出
- 卡方检验的基本原理
- 卡方检验在统计分析中的应用
-
如何处理负值特征的问题
-
示例1的数据分析过程
-
导入所需库
- 数据预处理流程
- 随机森林模型在过滤前的表现
- 采用卡方筛选方法保留前300个重要特征
- 评估不同k值的影响曲线
-
关于方法一中k值选取策略的探讨
-
示例2
-
- 概述
- 获得p值
- k值计算
-
总结
-
问题的引入
方差筛选出那些方差低于设定阈值的特征指标,在剩下的数据集中保留了方差较大的样本点,在一定程度上能够反映出这些样本点的变化情况,并不直接体现其与标签之间的关联性。
为了满足分析需求,在处理过程中我们更倾向于选择那些与目标变量高度相关且具有实际意义的输入变量。
通过这种方式我们可以获取丰富的信息资源并将其应用于后续建模过程。
在sklearn库中提供了三种常用的变量重要性评估方法分别是卡方检验F检验和互信息分析法本文仅采用了卡方检验方法来进行相关性分析。
卡方检验
卡方检验概述
卡方过滤专为离散变量(即分类问题)的相关性筛选设计
在scikit-learn中使用函数chi2来计算每个非负特征与标签之间的卡方统计量。然后按照统计量
全部评论 (0)
还没有任何评论哟~
