Advertisement

美国人口普查数据用于预测收入水平,并应用sklearn算法进行特征编码、特征选择、降维以及递归特征消除

阅读量:

了解美国人口普查数据预测收入sklearn算法汇总1: 了解数据以及数据预处理

六. 对特征进行编码

  • pd.get_dummies()
复制代码
    one_hot_cols = dataset_bin.columns.drop('predclass')
    dataset_bin_enc = pd.get_dummies(dataset_bin, columns=one_hot_cols)
    print(dataset_bin_enc.shape)
    dataset_bin_enc.head()

(48842, 105)

在这里插入图片描述

pd.factorize()

目的: 去掉NaN值, 便于数据编码

复制代码
    dataset_con_test = dataset_con
    dataset_con_test['workclass'] = dataset_con['workclass'].factorize()[0]
    dataset_con_test['occupation'] 

全部评论 (0)

还没有任何评论哟~