Titanic: Machine Learning from Disaster Kaggle竞赛入门学习笔记
发布时间
阅读量:
阅读量
Titanic: Machine Learning from Disaster
- 对于实验所用数据的理解,包括对数据中异常点或离群值的识别与处理,特征工程在其中发挥着至关重要的作用。
- 需要特别关注模型融合这一策略。
-
在训练数据中,缺失值是常见问题,通常有以下几种应对方法:
-
当缺失样本的比例非常高时,通常会选择直接剔除这些样本。若将其作为特征引入模型,反而可能引入噪声,从而对最终结果造成不利影响;
-
若缺失样本比例适中,并且该属性属于非连续型特征(如类别属性),可将NaN视为一个新的类别,并将其纳入类别特征中;
-
若缺失样本比例适中,并且该属性为连续型特征,则有时会考虑设定一个步长(例如年龄这一属性可以按每2或3岁为一个步长),将其离散化后,再将NaN作为一个类型加入到属性类别中;
-
在某些情况下,若缺失值的数量不多,则可以尝试根据已有数据进行拟合,进而补充这些缺失值。
-
在构建逻辑回归模型时,输入的特征必须为数值型。因此通常会对类别型特征进行因子化处理。所谓因子化是指:以Cabin为例,原本是一个单一维度的属性,但其取值可能是[‘yes’,
全部评论 (0)
还没有任何评论哟~
