K-Means聚类
发布时间
阅读量:
阅读量
K-Means聚类方法通常依据群体中特定的标签数值或相关属性特征,将其划分为若干类别,该技术归属于无监督学习范畴。
1. 聚类与分类
分类与聚类之间最显著的差异在于,分类是在已知分类规则的前提下,对数据集进行归类处理;而聚类则是在缺乏明确分类标准的情况下,将数据集中的样本按照相似性进行分组。
在分类任务中,数据集的类别数量是预先确定的。例如,在对用户性别进行划分时,人们通常会明确知道该数据集应划分为“男”和“女”两个类别。
而在聚类过程中,数据集所包含的类别数目是未知的。此时需要通过分析数据之间的相似性,将具有相近特征的数据点归为一类。例如,在预测用户的好友群体时,并不清楚用户之间具体的亲密度关系,因此需要依据他们的相似程度进行分组操作,最终形成若干个具有内部一致性的好友团体,这一过程即为聚类。
2. 算法步骤
【聚类算法的种类繁多,数量可达数十种,其中K-Means算法是应用最为广泛的一种。该算法的核心优势在于结构清晰、易于掌握以及计算效率较高,但其适用范围存在一定限制,仅能处理连续型数据,并且在实施聚类操作前必须由人工预先设定分类的数量。
接下来将对K-Means算法的运行流程进行简要说明。为避免过多使用数学符号,以下描述将尽量通俗易懂,其核心思想可以概括为“物以类聚、人以群分”。
**1. 首先确定k的数值,即希望将数据集划分为k个
全部评论 (0)
还没有任何评论哟~
