Advertisement

随机森林模型用于填补特征列缺失

阅读量:

随机森林方法填补缺失值

在日常的数据处理过程中,许多数据难以直接采用众数或平均值进行简单填充,此类操作可能会对数据的准确性产生负面影响。因此,有必要针对该特征列采用随机森林算法来完成缺失值的填补。

步骤如下:

  • 将需要进行缺失值填补的特征列单独提取出来,作为标签列Y
  • 从原始数据中选取所有不含缺失值的特征列,并包含原始标签列,作为输入变量X
  • 手动完成数据集的划分:
  • 将Y中存在缺失值的对应行划分为测试集xtest,而Y中无缺失值的部分则划分为训练集xtrain
  • 使用相同的方式对标签列Y进行划分,得到ytrain和ytest
  • 引入随机森林模块,利用xtest对ytest进行预测,从而实现对Y中所有缺失值的有效填补
复制代码
    data = pd.read_csv('rankingcard.csv', index_col=0)
    y_month = data.MonthlyIncome
    x = data.loc[:, data.columns != 'MonthlyIncome']
    # 取出y里面的空的部分和不是空的部分,非空的当做训练集,空的当做预测集
    xtest = x.loc[y_month.isnull(), :]
    xtrain = x.loc[y_month.notnull

全部评论 (0)

还没有任何评论哟~