Advertisement

K均值聚类

阅读量:

K-均值聚类是一种经典的无监督学习方法。
该方法由麦奎因于1967年首次提出。
其核心理念在于通过计算数据点与其所在簇中心的距离来进行数据分类。
具体而言,
第一步是将数据集初步划分为若干个簇,
第二步则是根据数据点与簇中心的距离重新分配到最近的簇中,
同时更新各簇的新中心位置;
第三步重复上述过程直至所有数据点稳定在各自的簇中。
此外,
通过mclust包提供的Mclust函数可以推断出最佳的聚类数量。
具体的实现步骤包括:
第一步是利用该算法推断出最佳的聚类数量;
第二步则调用kmeans函数对数据集进行实际分类;
第三步根据输出结果进一步优化初始参数设置。
值得注意的是,
Mclust算法提供了多种模型供选择,
共计14种不同的模型可供参考应用。

复制代码
    a=read.table("C:/Users/MrDavid/data_TS/beer.csv",sep=",",header=T)
    colnames(a)=c("name","heat","Na","alcohol","price")
    a=a[,-1]#去除分类标签
    #确定聚类的类数,利用mclust包来做
    library(mclust)
    m_clust = Mclust(as.matrix(a), G=1:5) #聚类数目从1一直试到20
    summary(m_cl

全部评论 (0)

还没有任何评论哟~