Advertisement

机器学习课程(二)——xgboost实战班 基于Pima印第安人数据集的机器学习 用于预测糖尿病发病率的分类算法

阅读量:

该数据集最初源于国家糖尿病/消化/肾脏疾病研究所,并旨在基于数据集中特定的医学指标实现对患者的糖尿病诊断性目标进行评估和分析。
为确保研究的有效性与准确性,在从较大数据库中筛选出这些病例时需要遵循若干限制条件。
值得注意的是,在本研究中所选取的所有病例均为Pima印第安女性且年龄不低于21岁。
该研究涉及多个医学预测变量以及一个二分类目标变量(Outcome)。具体而言,
这些预测因子包括患者的怀孕次数、身体质量指数(BMI)、血液中的胰岛素水平以及患者的年龄等多维度指标。

1 、加载库

复制代码
 import sys

    
 reload(sys)
    
 sys.setdefaultencoding('utf-8')
    
  
    
 import pandas as pd # 数据科学计算工具
    
 import numpy as np # 数值计算工具
    
 import matplotlib.pyplot as plt # 可视化
    
 import seaborn as sns # matplotlib的高级API
    
 %matplotlib inline # 在Notebook里面作图/嵌图
    
 %config InlineBackend.figure_format = 'retina

全部评论 (0)

还没有任何评论哟~