机器学习系列手记(五):K均值聚类
发布时间
阅读量:
阅读量
非监督学习
在实际应用过程中,常常会面临这样一类问题:向机器提供大量特征数据,并期待其通过学习过程识别出数据中潜在的共性特征、结构或变量间的关联,此类问题被定义为“非监督学习”问题。与监督学习不同,非监督学习并不以预测特定输出结果为目标,且输入数据通常不带有标签信息,需借助算法模型来揭示隐藏在数据内部的结构与模式。非监督学习主要涵盖两种类型的学习方法:数据聚类和特征变量之间的关联分析。其中,聚类算法一般依赖于多次迭代操作以实现对数据的最佳划分;而特征变量关联则通过多种相关性分析手段来揭示各变量之间存在的内在联系。
K均值聚类
相较于分类任务,聚类分析的特点在于无需预先掌握样本的类别标签信息,而是依据数据点之间的内在关联性,将它们划分为多个组别。在这一过程中,同组内的样本具有较高的相似性,而不同组之间的样本相似性则相对较低。因此,聚类分析被归类为非监督学习范畴。
1、K均值聚类
K均值聚类(K-Means Clustering)作为聚类分析中最基础且应用最为广泛的算法之一,其核心原理是借助迭代计算的方式,确定将数据划分为K个簇的最优方案,从而实现对代价函数的最小化。具体而言,该代价函数可被表述为所有样本与其所属簇中心点之间距离的平方误差总和,其数学表达式如下:
$J(c,\mu)=\sum_{i=1}^{M}||x_i- \mu_{C_i}|
全部评论 (0)
还没有任何评论哟~
