Advertisement

数据预处理:无量纲化(归一/标准化)

阅读量:

文章结构概览

  • 概述
      • 数据挖掘的五大核心流程
      • skleran中的数据处理与特征构建
    • 数据预处理Preprocessing

      • 数据无量纲化处理
        • 数据归一化---MinMaxScaler

          • 示例
        • 数据标准化----StandardScaler

          • 示例
        • MinMaxScaler和StandardScaler应如何选择

概述

数据挖掘五大步骤解析

  1. 数据获取

  2. 数据预处理
    数据预处理是指识别、修正或剔除数据集中存在缺陷、误差或不符合模型要求的记录的步骤
    可能遇到的问题包括:数据形式存在差异,例如部分为文本信息,部分为数值型数据,部分包含时间序列,有的具有连续性,有的则呈现离散特征。此外,数据质量也可能存在问题,如存在噪声干扰、异常值、缺失值、错误信息、单位不统一、重复记录、分布偏斜以及样本数量过多或过少等现象。
    数据预处理的目标:使数据符合模型的要求,并满足其运行条件

  3. 特征工程
    特征工程的核心在于将原始数据转化为更能体现预测模型潜在规律的特征变量,这可通过筛选关键特征、提取已有特征以及构造新特征等方式完成。其中构造新特征通常借助降维算法加以实现。
    可能

全部评论 (0)

还没有任何评论哟~