Advertisement

机器学习领域:K-Means算法

阅读量:

一、K-Means算法简介

聚类是一种将数据集中具有相似特征的个体进行归类与组织的方式,其本质是挖掘数据内部潜在结构的一种手段。该技术归属于机器学习中的无监督学习范畴。K-Means聚类作为划分式聚类方法中最为知名的算法之一,因其结构简单且运算高效而被广泛采用。在给定一组数据点以及用户预设的聚类数量k的前提下,K-Means算法依据特定的距离度量方式,持续将数据划分为k个类别之中。

二、算法基本思想

K-Means算法的操作逻辑较为直观。在该算法中,“簇”被用来表示一个聚类单元;可以证明,当所有质心不再发生变动时,K-Means算法即达到收敛状态。其基础运行流程如下:

  1. 确定k个初始质心(每个初始质心对应一个单独的数据点);
  2. repeat:
  3. 针对每一个样本点,计算其与各个质心之间的距离,并将其归入距离最近的质心所对应的簇中;
  4. 根据当前各簇所包含的数据点重新计算对应的质心(质心为该簇内所有样本点的平均值);
  5. until 质心的位置趋于稳定并停止变化;

K-Means的目标函数:

该方法的核心目标在于最小化畸变程度(即所有样本点与其所属簇中心之间距离的总和)。

![\underset{S}{arg min}\sum_{i=1}^{k}\sum_{x_{j}\in S_{

全部评论 (0)

还没有任何评论哟~