机器学习领域:K-Means算法
发布时间
阅读量:
阅读量
一、K-Means算法简介
聚类是一种将数据集中具有相似特征的个体进行归类与组织的方式,其本质是挖掘数据内部潜在结构的一种手段。该技术归属于机器学习中的无监督学习范畴。K-Means聚类作为划分式聚类方法中最为知名的算法之一,因其结构简单且运算高效而被广泛采用。在给定一组数据点以及用户预设的聚类数量k的前提下,K-Means算法依据特定的距离度量方式,持续将数据划分为k个类别之中。
二、算法基本思想
K-Means算法的操作逻辑较为直观。在该算法中,“簇”被用来表示一个聚类单元;可以证明,当所有质心不再发生变动时,K-Means算法即达到收敛状态。其基础运行流程如下:
- 确定k个初始质心(每个初始质心对应一个单独的数据点);
- repeat:
- 针对每一个样本点,计算其与各个质心之间的距离,并将其归入距离最近的质心所对应的簇中;
- 根据当前各簇所包含的数据点重新计算对应的质心(质心为该簇内所有样本点的平均值);
- until 质心的位置趋于稳定并停止变化;
K-Means的目标函数:
该方法的核心目标在于最小化畸变程度(即所有样本点与其所属簇中心之间距离的总和)。
