利用Python进行数据清洗和预处理
发布时间
阅读量:
阅读量
文章结构概述
-
- 数据整合
-
数据净化
-
初步数据分析(EDA)
-
数据集字段解释
-
-
- 程序实现
-
-
导入数据集
-
区分离散型变量与连续型变量
-
新增两列时间格式的数据项
-
引入冗余数据
-
特殊符号清理
-
统一时间格式表达方式
-
删除重复样本信息
-
进行初步分析工作
-
增加缺失值数据点
-
绘制缺失值分布图谱
-
针对连续型变量绘制箱型图,以识别潜在的异常点
-
检查数据整体分布情况
-
源代码
-
- 数据整合
在某些项目的启动阶段,首要任务是深入了解相关业务背景,随后作为‘程序员’,我们便开始处理所涉及的数据。第一步通常是执行数据清洗及预处理操作。本文将对数据清洗和预处理过程进行详细介绍。
数据集成
【在评分卡模型的开发过程中,一旦明确了相关需求,下一步便是数据的采集与整合工作。为全面反映借款人的信用特征,需从多个角度进行分析,包括但不限于借款人的基础信息、信用记录、消费行为以及操作行为等数据。
这一过程通常被称为数据扩充,例如通过唯一的标识符将业务系统数据与外部第三方数据进行关联和整合。
- 基本信息数据
全部评论 (0)
还没有任何评论哟~
