不均衡学习理论与实战总结
发布时间
阅读量:
阅读量
不平衡学习方法
在机器学习领域,样本分布不均衡现象通常可归纳为两种类型:
(1)各类别间样本数量比例存在差异,但每个类别所包含的样本总量均较为充足;
(2)某一类别中的样本数量明显偏少。
针对第二种情况,其并非当前研究的重点。当数据量不足时,所能覆盖的特征空间范围相对有限。若特征维度足够丰富,此类数据对于模型训练的实际帮助作用并不显著。因此,应对该问题的有效策略应聚焦于尽可能多地获取小类样本以拓展数据覆盖范围。
目前主要关注第一种情形。
一: 采样方法
1. 随机过采样(random oversampling):
在面对样本分布不均的情况时,通过随机复制小类样本以实现类别间的平衡。该方法的本质是对小类样本进行简单复制操作,其主要缺陷在于容易引发过拟合现象。例如,在决策树分类过程中,可能出现某个终端叶子节点仅由单一样本的复制构成的情况。虽然这种方法可能提升模型训练阶段的精度水平,但对未知测试样本的预测效果往往较差。
2. 随机欠采样(random undersampling):
当出现样本分布不均衡现象时,通过对大类样本实施随机删除操作以实现平衡状态。具体而言,即从大类中选取部分样本用于后续处理。然而这种方式存在一定的弊端:减少样本数量可能导致关键信息丢失,进而影响模型预测准确性。
3. 基于数据生成的合成采样(Synthetic Sampling
全部评论 (0)
还没有任何评论哟~
