Advertisement

机器学习 day1

阅读量:

数据集的构成

机器学习的数据:文件CSV

mysql不适合机器学习:

  1. 性能瓶颈,读取速度
  2. 格式不太符合机器学习要求数据的格式

读取工具:

  1. pandas:读取工具
  2. numpy:快的原因:把GIL锁释放了
一、 数据集的结构

可用数据集
scikit-learn的特点:

  1. 数据量较小
  2. 方便学习

kaggle特点:

  1. 大数据竞赛平台
  2. 80万科学家
  3. 真实数据
  4. 数据量巨大

UCI特点:

  1. 收录了360个数据集
  2. 覆盖科学、生活、经济等领域
  3. 数据量几十万

常用数据集的结构组成
结构:特征值+目标值

房子面积 房子位置 房子楼层 目标值
数据 80 9 3 80

注:有些数据集科研没有目标值
机器学习:数据中的重复值不需要去重

二、特征工程

通过提取原始数据中更准确地反映潜在问题特征的数据过程(即特征工程),显著提升了模型对未知数据预测的效果

重要概念:

1. 数据的特征抽取(feature_extraction)

将一个文本、字符串转换成数字就是特征抽取

1.**文本特

全部评论 (0)

还没有任何评论哟~