Advertisement

Titanic: Machine Learning from Disaster Kaggle竞赛入门学习笔记

阅读量:

Titanic: Machine Learning from Disaster

  1. 对于实验所用数据的理解,包括对数据中异常点或离群值的识别与处理,特征工程在其中发挥着至关重要的作用。
  2. 需要特别关注模型融合这一策略。

机器学习系列(3)_逻辑回归应用之Kaggle泰坦尼克之灾

  1. 在训练数据中,缺失值是常见问题,通常有以下几种应对方法:

  2. 当缺失样本的比例非常高时,通常会选择直接剔除这些样本。若将其作为特征引入模型,反而可能引入噪声,从而对最终结果造成不利影响;

  3. 若缺失样本比例适中,并且该属性属于非连续型特征(如类别属性),可将NaN视为一个新的类别,并将其纳入类别特征中;

  4. 若缺失样本比例适中,并且该属性为连续型特征,则有时会考虑设定一个步长(例如年龄这一属性可以按每2或3岁为一个步长),将其离散化后,再将NaN作为一个类型加入到属性类别中;

  5. 在某些情况下,若缺失值的数量不多,则可以尝试根据已有数据进行拟合,进而补充这些缺失值。

  6. 在构建逻辑回归模型时,输入的特征必须为数值型。因此通常会对类别型特征进行因子化处理。所谓因子化是指:以Cabin为例,原本是一个单一维度的属性,但其取值可能是[‘yes’,

全部评论 (0)

还没有任何评论哟~