Advertisement

数据科学与大数据分析学习心得-5章聚类分析

阅读量:

Clustering聚类方法应用

    • K-means聚类分析
      • 确定簇的数量
      • 诊断分析
      • 选择依据与注意事项
      • 其他相关算法
      • 基于密度的聚类方法
      • DBSCAN算法

聚类是一种利用无监督学习方式,将具有相似特征的数据对象归为一类,从而形成多个数据簇的过程。

K-means Clustering

设有m个对象的集合,其中每个对象均具备n个可测属性。
分四步进行:

  1. 确定k的取值,并对k个质心的初始估计值进行设定
    选定 k 值,以及 k 个质心的初始猜测值。

  2. 计算每个数据点(xi ,yi )到各个质心之间的距离,并将每个数据点分配至距离最近的质心。所有被分配至同一质心的数据点构成一个簇。最终形成 k 个簇,该过程采用欧几里得距离作为度量方式。

在这里插入图片描述
  1. 将每个簇的质心更新为该簇的质量中心,即计算步骤2中新生成的每个簇的重心。

![在这里插入图片描述](https://ad.itadn.com/c/weblog/blog-img/images/20

全部评论 (0)

还没有任何评论哟~