KNN的核心概念是基于特征空间中邻近样本的距离进行分类
发布时间
阅读量:
阅读量
1.什么是看KNN算法?
最基本最简单的分类器是记录所有训练数据所对应的各类别信息。当待测样本的各项属性与某一训练样本的属性完全吻合时,则将其归类到该对应类别中。然而,在现实中很难确保每一个测试样本都能精确匹配到一个训练样本;此外,在某些情况下会出现一个测试样本同时与多个训练样本具备相似性;基于这些问题的基础之上,则发展出了K近邻算法(KNN)。
K近邻算法(KNN)通过计算不同特征值之间的距离来进行分类决策。其思路在于:基于特征空间中各样本之间的距离进行分类决策;其中参数K表示选择邻居的数量,并且通常选择不超过20的数量;在实际应用中,默认选择奇数K以避免出现平局情况;该方法仅依据最近邻的一个或者几个具有明确类别标签的对象来推断待测样本所属的类别。
为了具体说明问题,请参考下图所示的例子:假设有三个红色三角形、两个蓝色四方形以及若干绿色圆形待测样例;对于绿色圆该如何分配到合适的类别中?假设选取最近邻数量为3(即K=3),此时绿色圆周围的邻居中有2个属于红色三角形类、1个属于蓝色四方形类,则根据多数投票原则将绿色圆归类于红色三角形类;若选取最近邻数量为5(即K=5),则在5个邻居中有3个属于蓝色四方形类、2个属于红色三角形类,则最终将绿色圆归于蓝色四方形类。

还没有任何评论哟~
