学习笔记:机器学习 day 2
发布时间
阅读量:
阅读量
一、sklearn数据集与估计器
1.sklearn数据集
1.数据集划分
通常分为两大类:训练集和测试集。其中训练集不仅用于训练模型以及模型构建(70%,75%,80%),而且在评估体系中起到关键作用;而测试集则在评估体系中起到关键作用(30%,25%,20%)。建议采用75%至25%的比例分配较为合理
API
sklearn.model_selection.train_test_split
- sklearn.datasets
加载获取流行数据集
- datasets.load_*()
获取小规模数据集,数据包含在datasets里
datasets.retrieve_(data_home=None) 可以从网络上下载大规模数据集。其第一个参数为data_home,表示数据集下载的位置,默认为~/scikit_learn_data/。
该数据集返回的数据类型
load_ 和 fetch_这两个函数返回的数据类型是以字典形式存储的
- data: feature array, which is a two-dimensional numpy.ndarray with shape [n_samples, n_features]
全部评论 (0)
还没有任何评论哟~
