聚类算法二 系统性比较
发布时间
阅读量:
阅读量
聚类旨在将数据集合中的样本划分为多个互不重叠的子集,每个子集被称为“簇”。该过程既可以独立运行,也可作为分类等其他学习任务的前置步骤。例如,在某些商业场景中,需要识别新用户的类别,但对商家而言,“用户类型”的定义往往较为困难。此时,通常先对用户数据实施聚类操作,依据聚类所得结果将各个簇视为一类,随后基于这些类别构建分类模型,以实现对新用户类型的判断。
网络上存在大量详尽的总结内容,其质量较高且内容丰富。然而数量过多,因此本文仅作简要归纳。
聚类算法系统性比较分析
| 聚类算法 | 思想 | 代表性算法及使用条件 | 优缺点 |
|---|---|---|---|
| 1、基于层次 | 1、将每个数据看成一类,计算两两之间的距离; 2、将距离最小的两个类合并为新类; 3、重新计算新类与其他所有的类之间的距离; 4、重复2~3,直到所有的类合并为一类 | 适合小数量级的聚类; 改进的算法有:BIRCH、chaneleon(比 BIRCH 更好用) | 优点: 1、可解释性好; 2、可以应用在 K-means 先去 K 值比较大的时候的最后合并阶段;能帮助解决k-means 不能解决的非凸数据 缺点: 1、时间复杂度高 2、贪心算法,一步错步步错 |
| 2、基于划分 | 基本思想:类内的点足够近、类间的点足够远 k-means 基本步骤: 1、随机选择 K 个点 ,当成 k 类 2、遍历所有的 |
全部评论 (0)
还没有任何评论哟~
