Advertisement

机器学习-K均值聚类及代码实现

阅读量:

KMeans聚类方法应用

在各类聚类算法中,k均值聚类(KMeans)无疑是最具代表性的方法之一,几乎所有关于数据挖掘或机器学习的教材都会对其进行详细介绍。初学者常常会将该算法与KNN等其他算法产生混淆。k均值作为一种典型的聚类方法,属于无监督学习范畴,而KNN则归属于有监督学习或分类学习的范畴。

所谓聚类,即根据事物之间的相似性将其归为一类。这一过程涉及多个关键概念:

  1. 如何对事物进行表示?通常情况下,我们会构建一个数据集用于存储相关数据,其中每一行对应一个独立的数据实例,每一列则代表该实例的一个特征属性。例如,在经典的鸢尾花(iris)分类数据集中,每条记录对应一朵花,并包含花萼长度、花萼宽度、花瓣长度以及花瓣宽度这四个特征参数,因此该数据集共有四列特征信息。

  2. 如何衡量不同事物之间的距离?在获取到各个数据点的特征值后,需依据具体场景选择适当的方法来计算两个数据点之间的差异程度。常见的计算方式包括欧氏距离、马氏距离以及余弦距离等。

  3. 聚类过程应遵循怎样的步骤?这需要依赖于具体的算法实现方式。目前主流的聚类方法主要包括基于划分、基于层次结构、基于密度分布以及基于网络结构等几大类别。其中k均值算法正是基于划分策略的一种典型代表,后续内容将继续探讨其他几种主流方法及其对应的代表性算法。

  4. 如何判断聚类过程是否完成?当各类别中

全部评论 (0)

还没有任何评论哟~