Advertisement

NLP中样本不平衡的问题

阅读量:

1. 什么是样本不平衡问题?

样本不平衡现象主要表现为数据集中各类别样本的数量分布存在明显差异。以二分类任务为例,当某一类样本的数量与另一类的比例超过4:1时,即可判定为存在数据不平衡问题,在某些极端情形下,正负样本的数量比例甚至可能高达1:1000。

2. 如何解决样本不平衡问题

1. 数据重采样

数据重采样技术主要通过对训练集实施重新抽样操作,使各类别样本数量趋于均衡,其核心策略可分为过采样与欠采样两类。其中,最基础的过采样方式是针对样本量较少的类别,通过随机重复选取其样本并将其补充至该类别中,直至满足预设的数量标准(此外,一种更为直接的操作方式是将小类别的样本进行复制,并将其添加至原始数据集内以形成新的数据集合)。相较而言,欠采样策略则聚焦于样本数量较多的类别,通过随机移除部分样本,使其规模与小类别趋于一致。然而需注意的是,过采样方法可能会引发模型对训练数据的过度拟合问题,而欠采样则存在因删除样本而导致部分训练信息丢失的风险。

2. 更改评价指标

在面对类别分布不均的情况时,accuracy 指标通常存在较大的误导性,其参考价值相对较低。此时可考虑引入其他评估方式:

  • precision:用于衡量所有被判定为正类的样本中真正为正类的比例,即 P = \frac{TP}{TP+FP}
  • recall:

全部评论 (0)

还没有任何评论哟~