Advertisement

机器学习sklearn支持向量机样本不均衡问题

阅读量:

文章目录

    • 前言
    • 样本不均衡的解决办法
    • 实例

前言

在分类任务中始终面临的一个挑战:样本分布失衡的问题。
例如我们有一个二分类数据集其中一类占3%另一类占97%这样的情况就是一个典型的样本分布失衡的数据集。然而我们的目标通常是尽可能准确地识别出这些少数类别中的样本。
然而我们的模型在训练时默认采用平衡的分布策略这就可能导致以下问题:
首先模型在分类过程中会倾向于优先识别多数类的样本从而导致多数类更容易被正确识别而牺牲掉少数类的信息
其次这种不平衡会影响模型的评估指标使得单纯的预测策略不再具有实际意义例如即使我们没有任何特征信息仅仅将所有样本预测为0类别也能达到97%的预测准确率这样的结果显然无法有效解决实际问题。

本文中使用的第三方库

复制代码
    import numpy as np
    from sklearn.datasets import make_blobs
    from sklearn.svm import SVC
    import matplotlib.pyplot as plt
    import warnings
    
    warnings.filterwarnings("ignore")
    %matplotlib inline

全部评论 (0)

还没有任何评论哟~