Advertisement

持续关注或更新Python机器学习的K-Means聚类

阅读量:

K-Means被视为一种聚类算法。此外,在无监督学习中还有一种称为聚类的技术。无需标注信息的学习过程通常仅依赖于特征矩阵X,并且这些方法不需要标签信息。

聚类的目标在于将数据划分为有意义或有价值的群体(即簇)。这种分群工作可以根据我们的业务目标或建模目标来进行执行;此外还可以纯粹用于探索数据的自然结构与分布情况。例如,在商业领域中,如果手头拥有大量关于现有及潜在客户的资料信息,则可以通过聚类方法将其划分为若干个群体以便进一步分析并开展营销活动。

可以看出,在数据分析中,聚类的目标就是实现数据分类。然而聚类与分类的本质区别在于:前者是一个无监督学习的过程,在这种情况下我们并没有预先设定好的训练数据或测试数据划分。在分类任务中(如机器学习中的监督学习),我们通常有一批已经标注好的数据样本(即带有分好类别的数据),其核心目标是利用这些训练数据的信息对未知测试数据进行类别归属;而聚类的不同在于它不需要任何先验知识的支持——也就是说,在开始分析之前我们还不知道各类别的数量及其特征)。具体来说,在无监督学习场景下(即聚类分析),我们的任务是根据某种相似性度量标准将大量未标记的数据自动划分为若干个簇(clusters)。每个簇内部的数据点应该具有较高的相似度(高相关性),而不同簇之间的点则表现出较低的相似度水平(低相关性)。为了直观地展示了两者之间的主要差异

![](https://cdl

全部评论 (0)

还没有任何评论哟~