Hadoop k-means算法
发布时间
阅读量:
阅读量
在经历了昨日的一系列准备工作后,在今日开始就可以着手编写完整的k-means算法程序。大致上,在编写程序时遇到了一个挑战具体发生在combine操作阶段。除了这一例外情况外,其余部分都是依照原计划推进的。再说说我的思路如何?
前期准备工作:在将数据文件上传至HDFS之前,请确保生成一个统一的标准基准文件作为参考依据。例如我的输入数据源位于以下位置:
0.0 0.2 0.4
0.3 0.2 0.4
0.4 0.2 0.4
0.5 0.2 0.4
5.0 5.2 5.4
6.0 5.2 6.4
4.0 5.2 4.4
10.3 10.4 10.5
10.3 10.4 10.5
10.3 10.4 10.5
然后要产生中心文件,可以使用如下命令来操作:
(1)、获取文件的总行数: wc data.txt 。可以得到文件的行数是 :10
(2)由于将数据划分为三类因此计算得出每类应取约3个样本这些行号可以选择不同的数值例如可以选择前三个样本头头头头头头数据。进而使用以下命令运行awk 'NR==1 || NR==3 || NR==6' data.txt > centers.txt最后将生成的centers.txt文件上传至HDFS
全部评论 (0)
还没有任何评论哟~
