机器学习的KNN算法
发布时间
阅读量:
阅读量
机器学习之KNN算法
——近朱者赤,近墨者黑
KNN算法概述
- KNN的全称是K-近邻算法(缩写为KNN),其核心概念在于通过寻找数据空间中与查询实例最接近的数据点来进行分类或回归分析。
- 核心思想:
- 当用于预测新的输入实例x时(即待测样本),算法会通过计算其与训练集中其他所有实例的距离度量(如欧氏距离)来确定其最近邻关系
- k-近邻算法(kNN)的工作原理是:对于给定的新数据点x,在训练数据集中找到与之最接近的k个邻居实例,并基于这些邻居的信息来进行分类或数值预测。
在分类任务中常用的方法是多数投票机制(majority voting),即将这k个邻居实例所属类别的众数作为最终分类结果;
在回归任务中则常用平均机制(mean),即将这k个邻居实例的实际输出特征取均值以获得回归预测结果;
同时也可以采用加权机制(weighted),即根据各邻居与查询实例的距离远近赋予不同权重来提升模型性能。
算法流程
收集数据:可以使用任何方法
准备数据:距离计算所需要的数值,最好是结构化的数据格式
当我们运用算法进行回归分析时,在处理某些离散型的字段时要求我们将它们转换为数值形式以便后续计算能够顺利展开。
方法一:replace
X2['球队市值'] = X2['球队市值
全部评论 (0)
还没有任何评论哟~
