机器学习系列手记(二):特征归一化、类别型特征、高维组合特征求索
发布时间
阅读量:
阅读量
特征工程
民间有句俗语,“巧妇难为无米之炊”。在机器学习领域,数据与特征相当于“米”,而模型与算法则扮演着“巧妇”的角色。若缺乏充足的数据或恰当的特征,即便模型结构再强大,也难以获得令人满意的输出结果。通常情况下,数据与特征的质量直接决定了机器学习任务的性能上限,而模型与算法的选择及其优化过程,则是不断向这一上限靠近的关键步骤。
特征工程指的是对原始数据实施一系列处理操作,将其转化为可供算法和模型使用的特征。其核心目标在于清除原始数据中的噪声和冗余信息,并构建更加有效的特征表达方式,从而更精准地描述问题本质以及预测模型之间的关联性。
特征工程之特征归一化、类别型特征、高维组合特征的处理、组合特征
一、特征归一化
为消除各类数据特征间的量纲差异,需对特征实施归一化操作,从而确保不同指标具备可比性。对数值型特征进行归一化处理,能够将所有特征统一至相近的数值范围之内,常用的处理方式主要包括以下两种。
1、线性函数归一化。该方法通过线性变换将原始数据映射至[0,1]区间内,实现对原始数据的等比例缩放。其对应的归一化公式如下:
X_{norm}=\frac{X-X_{min}}{X_{max}-X_{min}}
2、零均值归一化。这种方法将原始数据转换为均值为0且标准差为1的分布形式。若原始特征的均值设为\mu、
全部评论 (0)
还没有任何评论哟~
