Advertisement

缺失值处理——R语言

阅读量:

本研究重点阐述VIM与mice两个软件包的应用,所采用的数据集为VIM包中提供的哺乳动物睡眠数据sleep,旨在探讨62种哺乳动物在睡眠时长、生态学特征以及身体属性之间的关联性。其中,睡眠相关的指标包括做梦时长(Dream)、非做梦时长(NonD)及二者之和(Sleep)。身体属性指标涵盖体重(BodyWgt,单位为千克)、脑重量(BrainWgt,单位为克)、平均寿命(Span,单位为年)以及妊娠周期(Gest,单位为天)。生态学指标则涉及物种受到捕食的风险程度(Pred)、睡眠期间暴露于危险的水平(Exp)以及整体面临的风险等级(Danger),所有生态学变量均采用1至5的五级评分体系进行量化评估,其中1代表风险最低,5代表风险最高。

1 处理缺失值的步骤

一套完整的数据处理流程一般包括以下若干环节:
(1) 确认存在缺失的数据项;
(2) 分析引发数据缺失的具体因素;
(3) 通过移除含有缺失信息的样本或采用适当的数值进行填补(即插补)的方式处理缺失数据。
关于缺失数据的分类,主要包括三类:完全随机缺失(MCAR)、随机缺失(MAR)以及非随机缺失(NMAR)。

2 识别缺失值

在数据处理过程中,NA(不可得)用于表示缺失的数据项,而NaN(不是一个数)则用于标识无法定义的数值。Inf与-Inf分别对应正无穷和负无穷的数值形式。相应的检

全部评论 (0)

还没有任何评论哟~