Advertisement

机器学习中的k-近邻(kNN)算法案例分析

阅读量:

一、改进约会网站的配对效果

想要预测的目标变量:不喜欢的人、魅力一般的人、极具魅力的人

分析指标包括:累计飞行常客里程总量、游戏时长占比以及每周冰淇淋消费量。

约会数据信息被存储在名为datingTestSet.txt的文本文件中,并且每条样本信息独占一行,并共计有1000条记录。

实现步骤

1、将文本文件中的数据进行解析

#核心功能:实现文本文件数据的矩阵形式解析
#输入变量:filename 字符串类型;表示待处理的文本文件名称
#输出变量:return_mat 二维列表类型;表示解析后得到的矩阵数据
class_label_vector 列表类型;表示对应的分类标签向量

定义名为file2matrix的函数接受参数filename:
使用open函数以只读模式打开指定的文件
通过调用readlines方法获取所有行数据
计算得到文件中的总行数为
返回一个形状为(number_of_lines, 3)的零矩阵

class_label_vector = []
index = 0

label_dict = {'largeDoses': 3, 'smallDoses': 2, 'didntLike': 1}

readlines()获取全部内容并逐行存储在一个列表中

#删除字符串前后多余的空白字符后,并通过tab

全部评论 (0)

还没有任何评论哟~