随机森林模型用于填补特征列缺失
发布时间
阅读量:
阅读量
随机森林方法填补缺失值
在日常的数据处理过程中,许多数据难以直接采用众数或平均值进行简单填充,此类操作可能会对数据的准确性产生负面影响。因此,有必要针对该特征列采用随机森林算法来完成缺失值的填补。
步骤如下:
- 将需要进行缺失值填补的特征列单独提取出来,作为标签列Y
- 从原始数据中选取所有不含缺失值的特征列,并包含原始标签列,作为输入变量X
- 手动完成数据集的划分:
- 将Y中存在缺失值的对应行划分为测试集xtest,而Y中无缺失值的部分则划分为训练集xtrain
- 使用相同的方式对标签列Y进行划分,得到ytrain和ytest
- 引入随机森林模块,利用xtest对ytest进行预测,从而实现对Y中所有缺失值的有效填补
data = pd.read_csv('rankingcard.csv', index_col=0)
y_month = data.MonthlyIncome
x = data.loc[:, data.columns != 'MonthlyIncome']
# 取出y里面的空的部分和不是空的部分,非空的当做训练集,空的当做预测集
xtest = x.loc[y_month.isnull(), :]
xtrain = x.loc[y_month.notnull
全部评论 (0)
还没有任何评论哟~
