Advertisement

K-nearest neighbor algorithm

阅读量:

介绍

KNN算法的完整名称为k-Nearest Neighbor,其含义即为K最近邻。该算法属于分类方法的一种。相较于此前提及的决策树分类技术,此方法在复杂度方面相对更为简易。其核心操作流程如下:

1、提供一组已完成分类标注的训练样本数据集。
2、确定一个待测试的数据样本a,计算该样本与训练集中所有数据点之间的欧几里得距离,并将这些距离值进行排序处理。

3、从训练数据中挑选出与测试样本a距离最小的K个数据点。

4、对这K个数据点所对应的类别标签进行统计分析,确定出现频率最高的类别作为测试样本a的最终分类结果。

以下为百度百科提供的示意图:

KNN算法实现

首先,测试数据共需两组,一组为训练集数据,即已经完成分类处理的数据,例如上图中所展示的非绿色标记的点。另一组为测试数据,即图中显示的绿色标记点,当然这里的测试数据并非单一数据点,而是由多个数据点构成的集合。在这些数据之间,其相互间的距离计算依赖于数据的特征向量,而特征向量可以具有多个维度。通过计算不同特征向量之间的欧几里得距离,可以进一步评估它们之间的相似程度。定义训练集数据trainInput.txt

全部评论 (0)

还没有任何评论哟~