Advertisement

scikit-learn Pipeline

阅读量:

在机器学习项目实施过程中,通常需要对训练集执行多种数据预处理步骤,例如:特征提取、标准化处理以及主成分分析等。而在测试集上同样需要应用这些相同的参数设置,此时可以借助机器学习中提供的pipeline机制,以规避重复操作带来的冗余问题。

示例:

数据背景:城市共享单车计划是在城市内部设立多个自助租车站点。通过这一由站点构成的网络系统,用户能够自主完成自行车的租赁与归还操作。截至目前,全球范围内已建成超过500个此类自助式自行车租赁站点。

目标:基于历史数据(涵盖天气状况、时间信息、季节特征等变量),利用Pipeline工具构建回归模型,以预测特定条件下共享单车的租赁数量。

加载数据

复制代码
 # 加载数据集

    
 import pandas as pd
    
 import numpy as np
    
 data = pd.read_csv('daily-bike-share.csv')
    
 data.info()
    
    
    
    
  • mnth:表示数据对应的月份,取值范围为1至12
    • season:记

全部评论 (0)

还没有任何评论哟~