Advertisement

数据科学与大数据分析之聚类

阅读量:

聚类

  • 项目概况
    • 项目启动

项目介绍

文件TreeDB.csv中包含了258种树木的相关描述信息,该数据资源由XX市议会下属的开放空间与环境服务管理部门所提供。此数据集作为公共空间优质树木选择合作项目的一部分被公开共享。设想你现在是该项目团队中的一员,并且你决定参与聚类分析以更深入地了解该数据集的特性。在此次练习中,仅需关注“高度”、“宽度”、“表面积”以及“盐”这四个特征(属性)。

阐述你对这一数据集的整体看法,例如样本的数量、特征的总数以及这些选定特征所代表的实际意义。同时,应运用summary()函数来进一步提升对数据的理解程度。

绘制出所选属性的散点图矩阵,以便直观展示这四个变量之间的两两关系。

基于所选择的属性进行K-means聚类分析,并汇报相应的分析结果。同时需要说明你确定聚类数量的依据。

针对所选属性实施DBScan聚类方法,并汇报所得结果。此外,还需解释你是如何确定参数Eps与minPts的具体数值的。

将聚类的结果进行可视化呈现。

项目开始

1.获取数据信息并查阅相关概述

复制代码
    task2 <- read.csv("TreeDB.csv")
    summary(task2)
    
    
      

全部评论 (0)

还没有任何评论哟~