美国人口普查数据用于预测收入水平,并应用sklearn算法进行特征编码、特征选择、降维以及递归特征消除
发布时间
阅读量:
阅读量
了解美国人口普查数据预测收入sklearn算法汇总1: 了解数据以及数据预处理
六. 对特征进行编码
- pd.get_dummies()
one_hot_cols = dataset_bin.columns.drop('predclass')
dataset_bin_enc = pd.get_dummies(dataset_bin, columns=one_hot_cols)
print(dataset_bin_enc.shape)
dataset_bin_enc.head()
(48842, 105)

pd.factorize()
目的: 去掉NaN值, 便于数据编码
dataset_con_test = dataset_con
dataset_con_test['workclass'] = dataset_con['workclass'].factorize()[0]
dataset_con_test['occupation']
全部评论 (0)
还没有任何评论哟~
