The data set from sklearn
发布时间
阅读量:
阅读量
1. 数据集划分
数据集被划分为两个组成部分:
训练数据:用于模型的构建与训练过程
测试数据:在模型验证阶段加以应用,用以判断模型的有效性
2. sklearn数据集API(接口)
scikit-learn数据集API概述:
sklearn.datasets -----用于加载和获取常用数据集
datasets.load_ *()
用于获取小型数据集,相关数据已包含在datasets模块中
datasets.fetch_ *(data_home=None)
用于获取大型数据集,需要从网络下载。该函数的第一个参数为data_home,用以指定数据集的下载路径,默认路径为 ~/scikit_learn_data/。如需更改默认路径,可通过调整环境变量SCIKIT_LEARN_DATA实现。
关于获取数据集后返回的数据类型:
通过load和 fetch 函数所获取的数据类型均为 datasets.base.Bunch ,其本质是一个字典结构,支持通过对象属性的方式访问其中的键值对。主要包含以下属性:
data:特征数据数组(即特征值),该数组为 n_samples * n_features 的二维 numpy.ndarray 结构
target:标签数组(即目标值),该数组为 n_s
全部评论 (0)
还没有任何评论哟~
