Advertisement

用pandas进行数据预处理的步骤(Python版本)

阅读量:

目录

前言

一、数据加载与初步探索

1.1数据加载

输出结果如下

1.2初步探索

输出结果如下

二、数据清洗

2.1处理缺失值

2.2处理重复值

2.3处理异常值

​编辑

三、数据转换

3.1数据的类型转换

输出结果如下

3.2特征编码

输出结果如下

3.3特征缩放

输出结果如下

四、两张不同的数据表的数据预处理

五、标准化数据

5.1标准差标准化

5.2小数定标标准化

​编辑

输出效果如下

六、变换数据

6.1利用get—dummies函数进行哑变量处理

输出结果如下

七、离散化连续性数据

7.1等宽法

7.2等频法

7.3聚类分析法

八、箱线图分析

九、总结


前言

在现实世界中获取的数据往往会面临完整性缺失(如含有缺失值)、不一致性以及异常值等多种问题。若采用这些异常数据进行建模分析,则可能显著降低建模效率的同时还可能导致分析结果产生偏差。针对这些问题的有效解决办法是数据分析工作中亟需掌握的核心技能之一。本文将介绍四种常用的数据预处理方法:数据合并、清洗、标准化和转换。

思维导图:

全部评论 (0)

还没有任何评论哟~