Advertisement

原型聚类的K均值算法及其Python实现

阅读量:

原型聚类(prototype-based clustering)

原型聚类方法基于一个核心假设,即各类别可以通过一组代表性样本进行描述,此类技术在实际聚类任务中被广泛采用。一般情况下,该类算法首先对代表性样本进行初始设定,随后通过不断迭代优化以实现参数的更新计算。由于所采用的原型表达方式及求解策略存在差异,最终会形成不同的具体算法形式,其中较为典型的包括K均值算法、学习向量量化方法以及高斯混合聚类模型。

K均值算法

K均值算法,从名称即可理解,其核心在于将一组数据D=\left \{ x_{1},x_{2},...,x_{m} \right \}划分为K个类别。其中,“均值”这一概念,指的是对聚类后形成的簇集合C=\left \{ C_{1},C_{2},...,C_{k} \right \}进行平方误差的最小化操作。

在此过程中,\mu _{i}=\frac{1}{\left |C_{i} \right |}\sum _{x\in C_{i}}代表的是簇 C_{i}的均值向量。从直观角度来看,式(1.1)在某种程度上反映了簇内样本围绕该均值向量的集中程度,E值越低,则表示簇内样本之间的相似性越高。无需过多解释,直接按照贪心策略描述算法流程(参考周志华《机器学习》):


输入:样本集$D=\left { x_{1},x_{

全部评论 (0)

还没有任何评论哟~