Advertisement

scikit-learn 和 pandas 的决策树

阅读量:

在掌握pytorch框架中的神经网络技术后,再回过头来学习sklearn库中的机器学习算法,会发现其操作过程相对简便,仅需调用相应模型并执行fit函数即可。本文将结合sklearn中的决策树算法以及pandas库进行数据预处理,对经典的泰坦尼克号数据集展开分析,以探讨影响乘客获救的关键因素。
例子来源:张良均《python与数据挖掘》

数据处理

原始数据获取地址为:https://github.com/ffzs/ml_sklearn/tree/master/data。在项目初始目录下,需建立一个名为data的文件夹,并将相关数据文件存放于该目录中。

复制代码
    # 引入数据
    data = pd.read_csv('data/titanic_data.csv', encoding='utf-8')
    print(data.head())
    
      
      
      
    

所得结论如下:

复制代码
       Survived  PassengerId  Pclass     Sex   Age
    0         0            1       3    male  22.0
    1         1            2       1  female  38.0
    2

全部评论 (0)

还没有任何评论哟~