周志华《机器学习》中的聚类算法(python版本)
发布时间
阅读量:
阅读量
聚类算法
作为一种典型的无监督学习途径,聚类算法旨在通过分析未标注的训练样本,挖掘数据集内部所蕴含的潜在结构与规律,其核心特征在于不依赖于训练数据的类别标签信息。该方法的基本目标是将数据集中的样本划分为若干个相互重叠的类别群组 ,每个群组则对应一种潜在的分类模式 。
从直观层面来看,聚类过程本质上是将具有相似特征的样本进行归并,从而形成一个类别群组(Cluster) 。在此过程中,首要的问题是如何衡量样本之间的相似程度,这正是距离度量所要解决的关键问题。在日常生活中,我们通常认为差异较小的事物更为相似;在多维空间中,每个样本可视为一个数据点,若这些点之间的距离较为接近,则可以认为它们具有较高的相似性。接下来需要考虑的是如何评估聚类结果的质量,这便是性能度量的作用所在。性能度量为判断聚类效果提供了多种有效性评估指标 。
距离度量
在讨论距离度量时,最为常见的莫过于欧式距离,这一计算方式从年初至年末广泛应用于各类场景中,其定义为对应属性值差的平方和再开根号。除了欧式距离之外,还存在许多经典的距离度量方法,这些方法通常需要满足以下几个基本特性:
非负性dist(x_i,x_j)>=0;
同一性dist(x_i,x_j) = 0当且仅当x_i = x_j
对称性$dist(x_i,x_j) = dist(x_
全部评论 (0)
还没有任何评论哟~
