Advertisement

Python机器学习课程K-Means聚类分析

阅读量:

聚类(clustering)

聚类概念解析

聚类作为一种无监督学习(unsupervised learning)方法,其特点在于无需预先设定类别标签。
它属于数据挖掘领域中的经典算法之一。
该算法需要输入参数k,随后将数据样本划分为k个类别;在同一个类别内部,样本之间的相似性较高;而不同类别之间的样本相似性则相对较低
这意味着该方法无法自动判断类别的数量(因为k值必须在算法运行前确定),并且通常会随机选择初始点作为聚类中心进行计算。

算法描述

聚类算法的核心理念是选取空间中k个样本点作为初始中心,通过迭代方式对邻近的样本点进行归类,并持续优化各个聚类中心的位置,以实现最优的聚类效果。

具体的执行流程如下:
1. 确定k个聚类的初始中心点
随机选取k个作为初始的中心位置
2. 在第n次迭代过程中,针对每一个样本点,计算其与所有k个聚类中心之间的距离,并将其分配至距离最短的中心对应的类别中。
换句话说,就是比较该样本点到每个中心的距离,选择距离最近的那个作为归属类别。
3. 采用均值等统计方法对各类别进行中心值的更新
即在完成第二步后,计算各类别样本的平均值,并将此结果作为下一轮迭代的新中心点
4. 当所有k个聚类中心在经过第二、第三步迭代更新后**趋于稳定状态时,则停止迭代过程。

全部评论 (0)

还没有任何评论哟~