Advertisement

KNN

阅读量:

一、思想

  • 类似的物品聚集在一起。
    • 给定训练集D中存在一个测试样本x
      • 对于这个特定的测试样本x而言,
        • 计算该测试样本x与训练集D中所有样本的距离。
          • 在这些距离值中找到最小的k个距离。
            • 将这k个最近邻中的主要类别提取出来。
              • 根据这些主要类别的比例确定最终分类结果。

(一)k(划分的类数)的确定

  • k值较小:较低的训练误差与较高的泛化误差表明该模型对噪声较为敏感,并具有较高的复杂性易导致过拟合现象;过拟合通常与参数数量较多、样本数量较少以及过度优化过程相关联 *

k值较大时会倾向于出现较大的训练误差和较低的泛化能力,并且模型的复杂度较低。
欠拟合是因为参数不够多和训练不足

  • try [3,20]

(二)距离的度量

  • 默认情况:欧氏距离
  • 文本分类:夹角余弦

(三)类别的判定

  • 简单投票法:遵循多数占优原则,在近邻中属于哪个类别中的点数量最多,则被分类为此类别。
    • 加权投票法:根据各样本间的远近距离设定权重系数,在计算最终分类结果时将各邻居样本按照其与目标样本之间的距离计算相应的权重值。其中较近邻居所赋权重值较大,并具体采用与该距离平方成反比的方式计算。

二、存在问题

全部评论 (0)

还没有任何评论哟~