K-means, K-means++和Mini Batch k-means
发布时间
阅读量:
阅读量
K-means
K-means算法的基本步骤
- 在n个数据样本中随机选取k个数据点作为初始的聚类中心
- 将每一个数据点依据其与各个聚类中心的距离,分配至最近的类别中,随后根据当前类别内的所有数据点重新计算新的聚类中心
- 终止条件设定为:当新一轮计算后的聚类中心与上一轮结果完全一致时,算法停止运行
每个类别聚类中心的计算方法
每一个类别对应的聚类中心是该类别内所有样本在各个属性维度上的平均值(即质心)
k-means时间空间复杂度
时间复杂度:O(i * n * k * m)
空间复杂度:O(n * m)
其中k表示需要划分的簇数,m代表每个样本所具有的特征维度数量,n为总的样本数量,i为迭代次数
在多数情况下,这些参数可被视为固定值,因此时间与空间复杂度均可简化为O(n)
改进
K-means是一种广泛应用的聚类方法,然而其自身也存在一些局限性。例如,在面对大规模数据集时,会出现运算耗时较长的问题。对此可以从两个方向加以优化:其一是调整初始聚类中心的选取方式以降低迭代次数;其二是采用抽样策略,在计算过程中仅使用部分样本进行近似处理。主要改进方案包括以下两种类型
全部评论 (0)
还没有任何评论哟~
