Advertisement

数据挖掘中的模型填补方法

阅读量:

填补方法与样本量相关

在数据挖掘过程中通常会采用的数据填充方法与其样本数量之间的密切关系也值得注意。通常情况下,如果各个变量之间相互关联的程度较高,则倾向于采用更为普遍的方式进行模型填充。

样本量适中 的情况下,我会使用如下两种方式进行缺失值的填补

该方法主要通过proc \, stdize过程步实现数据填充功能,在实际应用中仅能采用基础统计指标的方式进行填补操作,并结合平均值与中间值等参数完成数据补全任务;此外,在执行过程中还可以同步完成样本的标准差分处理工作;在工作中这一技术手段因其高效性而被广泛应用

另一种方法基于proc mi过程步 ,这种方法可用于通过model进行缺失值填补

样本量较大 的情况下,我会使用如下两种方式进行缺失值的填补

该方法主要依赖于proc dmzip过程步,在数据挖掘领域中虽然均值的使用较为少见但更为常见的做法是采用中位数值来进行缺失值填充。该方法特别适用于数据之间相关性较低的情况,在这种情况下采用中位数值填充的方式能够显著提高填充效果。

另外一种方法则是基于决策树模型来进行缺失数据的填充工作,并且这种方法的一个显著优点就是在构建模型的过程中就能够有效识别并处理缺失值。

![](https://ad.itadn.com/c/weblog/blog-img/images/2025-0

全部评论 (0)

还没有任何评论哟~