kaggle上的泰坦尼克学习数据
发布时间
阅读量:
阅读量
数据分析项目小试牛刀——kaggle经典案例
在过去的这个学期期间,我选修了一门名为《非参数统计》的课程,在这门课程中老师要求我们使用LaTeX或R Markdown进行作业撰写,并且强调使用R语言作为编程工具。结束时发现自己在该课程中的表现尚可,并回想起这一学期的学习经历。每次作业都对我大有裨益:通过整合零星的知识点与代码片段形成完整的笔记体系是一种既复习又能加深理解的有效学习方式。泰坦尼克号的数据分析案例最早是在接触Python时完成的一个练习项目,并在此基础上将当时的分析思路进行了系统性的梳理和完善。此外,在参与过多个kaggle比赛的过程中也参考过他人的解决方案,并在此过程中做了自己的融合与创新。
数据基本结构了解
进行数据分析前,首先要明确目的,然后拿到的数据集做大致的了解。
载入数据
1、数据集:
训练集包括以下字段:乘客编号(passengerID)、是否得救(Survived)、舱位等级(Pclass)、姓名(Name)、性别(Sex)、年龄(Age)、兄弟姐妹及配偶数量(SibSp)、父母与子女数量(Parch)、票务号、票价(Fare)、客舱号(Cabin)以及上船地点(Embarked)。测试集则缺少"是否得救"这一字段。
2、载入数据集并审视其规模
from sklearn.ensemble import Ra
全部评论 (0)
还没有任何评论哟~
