机器学习基础课程中涉及特征工程的学习
发布时间
阅读量:
阅读量
特征工程
特征提取
在完成原始数据向实向量的转换后,为使模型能够更有效地学习其中的规律,需对特征进行进一步的处理与调整。首先,应深入分析业务数据及其背后的逻辑关系;其次,需全面掌握模型与算法的运行机制,并明确模型对输入数据的具体要求,以确保最终结果的准确性。
探索性数据分析
探索性数据分析(EDA)
在尽可能减少预先设定假设的前提下,对数据内部的结构与规律进行深入挖掘。该过程体现为一种系统性的分析方法,而非具体的单一技术手段。
图形化呈现
包括箱线图、柱状图、多维变量图、点阵图等各类图表形式。
数值化分析
涵盖样本平均值、数据离散程度、分布分位点、峰度系数以及偏斜程度等统计指标。
数值特征分析
截断
过高的精度数值可能包含噪声干扰。针对长尾分布的数据,可先实施对数变换处理,随后进行截断操作。
二值化
判断其是否存在。
分桶
若某一特征跨越多个数量级,则难以成为优质的特征表达。在逻辑回归模型中,每个特征对应一个独立的系数,模型对于具有较大数值的特征会表现出更高的敏感性。
平均分桶
采用固定宽度进行区间划分的分桶方式。
幂分桶
依据10的幂次方进行区间划分,该方法与对数变换存在密切关联。
分位数分桶
当数值型变量的取值范围存在显著差异时
全部评论 (0)
还没有任何评论哟~
