数据科学与大数据分析之聚类
发布时间
阅读量:
阅读量
聚类
- 项目概况
- 项目启动
项目介绍
文件TreeDB.csv中包含了258种树木的相关描述信息,该数据资源由XX市议会下属的开放空间与环境服务管理部门所提供。此数据集作为公共空间优质树木选择合作项目的一部分被公开共享。设想你现在是该项目团队中的一员,并且你决定参与聚类分析以更深入地了解该数据集的特性。在此次练习中,仅需关注“高度”、“宽度”、“表面积”以及“盐”这四个特征(属性)。
阐述你对这一数据集的整体看法,例如样本的数量、特征的总数以及这些选定特征所代表的实际意义。同时,应运用summary()函数来进一步提升对数据的理解程度。
绘制出所选属性的散点图矩阵,以便直观展示这四个变量之间的两两关系。
基于所选择的属性进行K-means聚类分析,并汇报相应的分析结果。同时需要说明你确定聚类数量的依据。
针对所选属性实施DBScan聚类方法,并汇报所得结果。此外,还需解释你是如何确定参数Eps与minPts的具体数值的。
将聚类的结果进行可视化呈现。
项目开始
1.获取数据信息并查阅相关概述
task2 <- read.csv("TreeDB.csv")
summary(task2)
全部评论 (0)
还没有任何评论哟~
