Advertisement

Python(Pipeline)

阅读量:

sklearn-Pipeline

导入numpy库,并以np为其简写形式;
导入pandas库,并以pd为其名称;
导入matplotlib的pyplot模块,并以plt为其简写形式;
从sklearn模块中导入预处理功能;
获取sklearn自带的标准数据集;
进行数据集的划分、超参数调优和交叉验证评估;
实现特征选择方法;
使用极端随机森林算法构建分类器;
构建管道式机器学习工作流程;
使用准确率作为评估指标。

import warnings
warnings.filterwarnings('ignore')

dataset = datasets.load_wine()
x,y = dataset.data,dataset.target

打印管道概览
编码器初始化为预处理库中的标准缩放器
特征选择器基于F回归统计量选择前8个特征
分类模型设置为随机森林算法,默认参数配置
将编码器、特征选择器和模型集成到管道中
对管道进行训练拟合数据集
获取并筛选出重要特征指标
初始化空列表用于存储选定特征索引
遍历特征重要性评估结果列表
判断当前特征重要性标志位是否为真值
如果是则将当前索引添加至选定列表中
打印输出选定特征索引信息
利用管道对象进行预测操作
计算预测结果与真实标签之

全部评论 (0)

还没有任何评论哟~