系统性应对数据缺失问题
发布时间
阅读量:
阅读量
数据缺失现象是数据科学家在进行数据处理过程中频繁遭遇的挑战,作者根据不同的实际场景提出了相应的数据插补策略。不存在绝对完美的数据插补方式,但总有一种方法更适合当前的具体情况。
在我从事数据清洗与探索性分析的过程中,最常遇到的问题之一便是如何应对缺失的数据。首先需要明确的是,没有任何一种手段可以彻底解决这一问题。针对不同的问题类型,通常会采用多种数据插补方法,例如时间序列分析、机器学习模型以及回归分析等,这些方法难以适用于所有场景。在本文中,我将尝试归纳最为常见的几种处理方式,并探索一套系统化的解决方案。
数据插补与数据删除的对比
在探讨具体的数据插补技术之前,我们有必要先了解导致数据缺失的根本原因。
1、随机缺失(MAR,Missing at Random):此类缺失指的是数据丢失的概率并不依赖于缺失值本身,而仅仅与部分已经观测到的数据存在关联。
2、完全随机缺失(MCAR,Missing Completely at Random):在这种情况下,数据丢失的概率既不依赖于其假设值也不受其他变量的影响。
3、非随机缺失(MNAR,Missing not at Random):该类情况包含两种可能性。一种是缺失值与所假设的变量有关(比如高收入人群往往不愿意透露自己的收入水平);另一种是缺失值受到其他变量的影响(如女性可能不愿公开自己的年龄信息,则年龄变量的缺失便
全部评论 (0)
还没有任何评论哟~
