机器学习中的数据预处理任务:对缺失值进行去填充、去除异常值以及删除重复项的操作
发布时间
阅读量:
阅读量
机器学习之数据预处理——数据清洗缺失值、异常值和重复值的处理
-
基础知识概述
- 技术要点归纳
- 数据列缺失情况的应对策略
- 1、舍弃(缺失值处理)
- 1、生成一份模拟数据集
- 2、识别哪些字段存在缺失
- 3、提取包含NA字段
- 4、识别所有字段均为NA的情况
- 5、舍弃存在缺失值的记录
- 1、生成一份模拟数据集
-
2、补全(缺失值处理)
-
- 1、通过调用sklearn库中的方法来处理缺失值
-
- 采用该列数据的平均数来填补缺失值
-
用该列数据的中间数值进行填补
-
以该列数据出现次数最多的数值来替代
-
2、通过Pandas库实现数据填补策略
* * 采用后续行的数据填充当前行的空缺-
前后结合的数据进行填补操作以保证完整性
-
借助前后顺序信息完成数据填充过程
-
设定默认填充数值为零以避免潜在偏差
-
对各字段分别设定替代数值以避免数据偏差
-
计算各列均值得分用于填补空缺处
使用pandas库中的replace函数来处理数据空缺处 -
3、异常值处理
-
- 知识点
- 1、箱线图
- 2、正态分布图法
- 3、通过Z-Score
-
全部评论 (0)
还没有任何评论哟~
