scikit-learn Pipeline
发布时间
阅读量:
阅读量
在机器学习项目实施过程中,通常需要对训练集执行多种数据预处理步骤,例如:特征提取、标准化处理以及主成分分析等。而在测试集上同样需要应用这些相同的参数设置,此时可以借助机器学习中提供的pipeline机制,以规避重复操作带来的冗余问题。
示例:
数据背景:城市共享单车计划是在城市内部设立多个自助租车站点。通过这一由站点构成的网络系统,用户能够自主完成自行车的租赁与归还操作。截至目前,全球范围内已建成超过500个此类自助式自行车租赁站点。
目标:基于历史数据(涵盖天气状况、时间信息、季节特征等变量),利用Pipeline工具构建回归模型,以预测特定条件下共享单车的租赁数量。
加载数据
# 加载数据集
import pandas as pd
import numpy as np
data = pd.read_csv('daily-bike-share.csv')
data.info()

- mnth:表示数据对应的月份,取值范围为1至12
- season:记
全部评论 (0)
还没有任何评论哟~
