Hadoop自带示例wordcount及其run procedure
发布时间
阅读量:
阅读量
基于Linux平台创建多台功能互通的虚拟机;基于完全分布式集群模式构建Hadoop环境;通过Hadoop自带的WordCount工具进行具体操作流程。本文着重介绍第三步:利用WordCount指令对大数据集进行处理并分析;在本节内容展开之前,默认已启动了完整的Hadoop环境;我们搭建的是一个基于Linux平台搭建了独立且功能互通的多台虚拟机;通过配置并运行WordCount脚本完成数据处理任务;完成所有设置后,请确保所有节点均已正常接入网络并能够互相通信;最后将运行结果导出至本地文件夹,并生成相应的分析报告
单词计数作为最简单的程序之一,在体现MapReduce核心思想方面具有显著作用;它可被视为MapReduce范例程序;该程序的完整代码可在Hadoop官方文档指定的'examples'目录中获取;其主要功能是统计给定文本文件中各单词出现频率;如图所示

1.创建本地示例文件
在/usr/hadoop目录中设置文件夹结构如下:
随后建立两个文本文件:file1.txt和file2.txt。
其中(file1.txt)的内容设为"Hello World
全部评论 (0)
还没有任何评论哟~
