Advertisement

R语言的几种方法用于处理样本不平衡问题

阅读量:

在处理存在类别分布不均现象的分类数据集时,机器学习模型的表现可能不够稳定,其预测结果甚至可能出现偏差,此时所测得的预测精度也容易产生误导。对于样本数量较少的类别而言,任何算法都难以从中提取到足够多的信息以实现精准预测。因此,通常要求将机器学习算法应用于平衡后的数据集。不平衡分类属于有监督学习的一种形式,其特点是其中一个类别的占比显著高于其他类别。相较于多分类问题,此类问题在二分类任务中更为普遍。所谓“不平衡”,指的是响应变量(即被解释变量)在各类别间的分布存在显著差异,当某一数据集中响应变量在不同类别上的分布差距较大时,则认为该数据集处于不平衡状态。

例如,假设我们拥有一个包含100000个观测值的数据集,其中记录了哈佛大学申请者的信息。众所周知,哈佛大学的录取率极低,因此该数据集中的响应变量(即申请人是否被录取,“是”为1,“否”为0)呈现出明显的不平衡特征,大约98%的观测值对应的响应变量为0,仅有2%的申请者成功获得录取资格。

在现实生活中,这样的例子更是数不胜数,在此列举几个实例供参考,请注意这些案例之间的不平衡程度各不相同。

l 一台自动产品质量检测设备每天会对工厂生产的产品进行检测,在实际运行过程中可以发现次品的比例远低于合格品的比例。

l 某地开展居民癌症筛查工作后发现,患癌人数远远少于健康人群的数量。

l 在信用卡欺诈相关的数据集中违规交易的数量相较合规交

全部评论 (0)

还没有任何评论哟~