层次聚类实例的Java开发
发布时间
阅读量:
阅读量
本文旨在详细阐述一个层次聚类的具体案例分析,在实际应用中使用层次聚类算法来进行相似图书目录的分类处理。由于Kmeans算法需要预先设定类别数量而无法自动适应不同数据集的特点,在本例中存在较大的不确定性因此选择层次聚类方法更为合适特别适合于此类场景本文将深入探讨该算法的基本原理并展示如何利用其Java代码实现来完成具体的文本分类任务具体代码可参考作者提供的GitHub仓库(访问链接)
层次聚类
该层次聚类方法将给定的数据集划分为层次结构直到满足特定条件。具体而言又可分为凝聚型与分裂型两种方案
这里重点介绍一下第一种自下而上的层次聚类:
给定N个待聚类的数据样本,在层次聚类中(自顶向下的策略),基本操作流程如下:
- 初始化阶段将每个样本独立成一类,并计算每对类别之间的相似度;
- 识别当前各类中距离最近的两个类别并进行合并;
- 更新新生成类别与其他现有类别之间的相似度指标;
- 反复执行上述步骤直至所有数据点被整合为单一类别或满足终止条件。
在执行聚类的过程中,在第二阶段设定一个阈值(threshold),如果最近两个类别之间的距离超过该阈值,则认为迭代过程可在此时终止)。这一关键步骤的核心在于第三阶段(step 3),即如何量化衡量两类之间
全部评论 (0)
还没有任何评论哟~
