第3种聚类算法——基于密度的DBSCAN如例
发布时间
阅读量:
阅读量
下一篇博客指出K-kmeans算法的主要缺陷之一是无法处理非凸数据集;换句话说,在大多数情况下,K-means算法只能识别具有球形分布的数据;为此,本文提出了一种新的基于密度的空间聚类方法,该方法能够识别任意形状的数据分布
基于密度的方法通过分析样本的空间密度分布来进行数据分组。通常,在处理数据时它主要关注数据点之间的连通性并将其划分为若干类别这一过程被称为DBSCAN算法的核心思想
DBSCAN 算法有两个参数:半径 eps 和密度阈值 MinPts, 具体步骤为:
将每个数据点 xi 设为中心,在其周围构建一个圆形区域(即所谓的 ε-neighborhood),该区域则被定义为 xi 的 ε 邻域
对位于该圆圈内的所有点进行统计数量。当且仅当下述条件满足时:圆圈内部所包含的点的数量超过给定密度阈值 MinPts,则将该圆圈中心位置标记为核心对象(core object)。若某一点在其 ε 范围内所包含的点数少于 MinPts 值但又位于某一核心对象之 ε 邻域内,则称其为边界对象(border object)。那些既不属于核心对象也不属于边界对象的对象则被归类为噪声(noise)。
3、关键节点xi的所有ε邻域内的全部的点都属于xi的直接密度可达区域。若xj是由xi通过密度直接到达的,xk是由xj通过密度直接到达...xn是由xk通过密度直接到达,那
全部评论 (0)
还没有任何评论哟~
