Kaggle Titanic挑战生存预测模型训练及交叉验证详细步骤解析数据预处理
发布时间
阅读量:
阅读量
本博客所有内容均源自《Hands-On Machine Learning with Scikit-Learn & TensorFlow》一书及其GitHub源码。
研读《Hands-On》至第三章,在其中的后半部分练习题涉及编程实践。通过动手实践感觉收获颇丰,并作为学习笔记予以记录。
运行环境:Jupyter Notebook 语言:Python3.6.4
0、题目描述
泰坦尼克号水难事件是历史上最著名的灾难之一。它要求我们根据乘客的年龄、性别、舱位等级以及登船位置等信息来预测每位乘客是否最终获救。尽管如此,在这场被称为永不沉没的事件中仅仅造成了几百人的伤亡。然而这些遇难者大多来自低级舱位的经济阶层而幸存下来的大多都是高级别的头等舱乘客!因此让我们系统地分析数据并运用机器学习模型预测每位乘客的命运如何?
具体哪些特征我们需要在下载相关数据集后自行进行分析;我们的主要目标是通过分析来判断某一ID乘客是否在这次沉船事故中生还,并将预测结果提交至Kaggle平台即可获得相应的训练分数。
在这个阶段中,我们省略了生成预测数据为CSV文件以及上传数据这两个步骤,主要目的是为了对数据预处理、模型训练与交叉验证这三个机器学习过程进行深入分析并详细阐述.我们的总体目标是实现80%以上的分类精度,并在此基础上设定一个阶段性的小目标.
1、
全部评论 (0)
还没有任何评论哟~
