Advertisement

The data set from sklearn

阅读量:

1. 数据集划分

数据集被划分为两个组成部分:

训练数据:用于模型的构建与训练过程

测试数据:在模型验证阶段加以应用,用以判断模型的有效性

2. sklearn数据集API(接口)

scikit-learn数据集API概述:

sklearn.datasets -----用于加载和获取常用数据集

datasets.load_ *()

用于获取小型数据集,相关数据已包含在datasets模块中

datasets.fetch_ *(data_home=None)

用于获取大型数据集,需要从网络下载。该函数的第一个参数为data_home,用以指定数据集的下载路径,默认路径为 ~/scikit_learn_data/。如需更改默认路径,可通过调整环境变量SCIKIT_LEARN_DATA实现。

关于获取数据集后返回的数据类型:

通过load和 fetch 函数所获取的数据类型均为 datasets.base.Bunch ,其本质是一个字典结构,支持通过对象属性的方式访问其中的键值对。主要包含以下属性:

data:特征数据数组(即特征值),该数组为 n_samples * n_features 的二维 numpy.ndarray 结构

target:标签数组(即目标值),该数组为 n_s

全部评论 (0)

还没有任何评论哟~