Advertisement

特征选择

阅读量:

从特定的特征集合中提取出具有关联性的子集,这一操作被定义为特征选择。作为数据预处理环节中的关键步骤,scikit-learn 机器学习库为实现该目标提供了两种不同的特征筛选途径:RFE和决策树

1、为什么要进行特征选择?

1) 解决维度灾难的问题,降低运算量,使模型泛化能力更强,减少过拟合

缩短模型训练所需的时间。数据量的减少将使算法的训练过程更加高效。通过剔除冗余信息,可以有效降低因噪声干扰而产生错误判断的可能性。

特征筛选与维度缩减是应对高维数据问题的两种关键技术手段。

2)去除不相关特征可以降低学习难度。增强对特征和特征值之间的理解。

3)提高准确度

降低具有误导性的数据量,将有助于增强模型的精确性。

2、 无关特征与冗余特征

1)无关特征:与当前学习任务无关

2)冗余特征:它们所包含的信息能从其他特征中推演出。

例如,当特征集合中已包含长度与宽度这两个属性时,面积则被视为一种冗余特征。此类特征在多数情形下并不会产生实际影响,但特定条件下可能有助于简化学习过程。参见《西瓜书》第247页

3、特征选择的方法:

1)

全部评论 (0)

还没有任何评论哟~