机器学习 day1
发布时间
阅读量:
阅读量
数据集的构成
机器学习的数据:文件CSV
mysql不适合机器学习:
- 性能瓶颈,读取速度
- 格式不太符合机器学习要求数据的格式
读取工具:
- pandas:读取工具
- numpy:快的原因:把GIL锁释放了
一、 数据集的结构
可用数据集
scikit-learn的特点:
- 数据量较小
- 方便学习
kaggle特点:
- 大数据竞赛平台
- 80万科学家
- 真实数据
- 数据量巨大
UCI特点:
- 收录了360个数据集
- 覆盖科学、生活、经济等领域
- 数据量几十万
常用数据集的结构组成
结构:特征值+目标值
| 房子面积 | 房子位置 | 房子楼层 | 目标值 | |
|---|---|---|---|---|
| 数据 | 80 | 9 | 3 | 80 |
注:有些数据集科研没有目标值
机器学习:数据中的重复值不需要去重
二、特征工程
通过提取原始数据中更准确地反映潜在问题特征的数据过程(即特征工程),显著提升了模型对未知数据预测的效果
重要概念:
1. 数据的特征抽取(feature_extraction)
将一个文本、字符串转换成数字就是特征抽取
1.**文本特
全部评论 (0)
还没有任何评论哟~
