Advertisement

Python dataset: breast_cancer dataset.

阅读量:

数据集:乳腺癌数据集(from sklearn.datasets import load_breast_cancer)。

将样本集分为70%作为主要训练数据集与30%作为测试数据集,并在模型建立前需对数据进行标准化处理。随后分别采用逻辑回归模型与KNN分类器(不设置任何预设参数值)进行建模,并生成相应的测试结果报告

(2)利用搜索网格,分别确定逻辑回归及KNN模型的最优参数。
KNN算法的主要参数提示:
①n_neighbors(最近邻个数)
取值一般为奇数。
②algorithm(用于计算最近邻的算法)
取值有‘auto’, ‘ball_tree’, ‘kd_tree’, ‘brute’等,默认为‘auto’。注意:算法选择不影响KNN的最终结果,只影响模型的性能(计算的快慢程度)。
③p(Minkowski距离的指标参数)
默认取p=2,即欧氏距离。而p=1为曼哈顿距离。如果需要使用非明氏距离的其它指标,应修改metric参数的值。
④weights(权重)
预测中使用的权重函数。可能的取值:‘uniform’:统一权重,即每个邻域中的所有点均被加权。 ‘distance’:权重点与其距离的倒数,在这种情况下,查询点的近邻比远处的近邻具有更大的影响力。

(3)采用K折交叉验证法对完整数据集进行评估(k取值范围为2至10),基于逻辑回归算

全部评论 (0)

还没有任何评论哟~