Advertisement

机器学习中的数据预处理任务:对缺失值进行去填充、去除异常值以及删除重复项的操作

阅读量:

机器学习之数据预处理——数据清洗缺失值、异常值和重复值的处理

  • 基础知识概述

    • 技术要点归纳
    • 数据列缺失情况的应对策略
    • 1、舍弃(缺失值处理)
      • 1、生成一份模拟数据集
        • 2、识别哪些字段存在缺失
        • 3、提取包含NA字段
        • 4、识别所有字段均为NA的情况
        • 5、舍弃存在缺失值的记录
  • 2、补全(缺失值处理)

    • 1、通过调用sklearn库中的方法来处理缺失值
    • 采用该列数据的平均数来填补缺失值
  • 用该列数据的中间数值进行填补

  • 以该列数据出现次数最多的数值来替代

  • 2、通过Pandas库实现数据填补策略
    * * 采用后续行的数据填充当前行的空缺

    • 前后结合的数据进行填补操作以保证完整性

    • 借助前后顺序信息完成数据填充过程

    • 设定默认填充数值为零以避免潜在偏差

    • 对各字段分别设定替代数值以避免数据偏差

    • 计算各列均值得分用于填补空缺处
      使用pandas库中的replace函数来处理数据空缺处

    • 3、异常值处理

      • 知识点
      • 1、箱线图
      • 2、正态分布图法
      • 3、通过Z-Score

全部评论 (0)

还没有任何评论哟~