机器学习处理数据
发布时间
阅读量:
阅读量

一. 缺失值处理
在各个数据集上出现的不同表现形式来展示缺失值问题
1.删除法
通过去除含有缺失值的数据点以获取一个完整的数据子集。这种操作既可应用于去除特征(列),也可应用于去除样本(行)。在数据分析中通常会对数据进行完整性检查并采取相应的处理措施。例如,在某些情况下我们可能选择移除那些具有较高缺失值比例的特征或者剔除那些存在大量缺失值的样本以确保后续分析的有效性。具体来说针对特定的数据处理场景我们可以根据以下条件选择适当的操作策略:首先对于那些具有较高缺失值比例但对数据分析目标影响较小的特征我们通常会选择将其标记为无效并予以移除;其次对于那些存在多个特征缺失但这些丢失的数据量在整体数据集中所占比例较低的情况我们则倾向于保留这些记录以便尽可能完整地利用原始数据信息。
2 .均值填补
评估该特征值中有效(连续数据)的平均情况;对于非数值型或离散型数据,则分别采用中位数和众数作为替代策略。
3 .随机填补
基于均值填补法引入随机因素,并通过提高缺失数据分布的均匀程度来解决问题
4 .基于模型的填补
将y视为预测
全部评论 (0)
还没有任何评论哟~
