Advertisement

学习笔记:机器学习 day 2

阅读量:
一、sklearn数据集与估计器
1.sklearn数据集
1.数据集划分

通常分为两大类:训练集测试集。其中训练集不仅用于训练模型以及模型构建(70%,75%,80%),而且在评估体系中起到关键作用;而测试集则在评估体系中起到关键作用(30%,25%,20%)。建议采用75%至25%的比例分配较为合理

API
sklearn.model_selection.train_test_split

- sklearn.datasets
加载获取流行数据集

  • datasets.load_*()
    获取小规模数据集,数据包含在datasets里

datasets.retrieve_(data_home=None) 可以从网络上下载大规模数据集。其第一个参数为data_home,表示数据集下载的位置,默认为~/scikit_learn_data/。

该数据集返回的数据类型
load_ 和 fetch_这两个函数返回的数据类型是以字典形式存储的

  • data: feature array, which is a two-dimensional numpy.ndarray with shape [n_samples, n_features]

全部评论 (0)

还没有任何评论哟~