Advertisement

Hadoop自带示例wordcount及其run procedure

阅读量:

基于Linux平台创建多台功能互通的虚拟机;基于完全分布式集群模式构建Hadoop环境;通过Hadoop自带的WordCount工具进行具体操作流程。本文着重介绍第三步:利用WordCount指令对大数据集进行处理并分析;在本节内容展开之前,默认已启动了完整的Hadoop环境;我们搭建的是一个基于Linux平台搭建了独立且功能互通的多台虚拟机;通过配置并运行WordCount脚本完成数据处理任务;完成所有设置后,请确保所有节点均已正常接入网络并能够互相通信;最后将运行结果导出至本地文件夹,并生成相应的分析报告

单词计数作为最简单的程序之一,在体现MapReduce核心思想方面具有显著作用;它可被视为MapReduce范例程序;该程序的完整代码可在Hadoop官方文档指定的'examples'目录中获取;其主要功能是统计给定文本文件中各单词出现频率;如图所示

这里写图片描述

1.创建本地示例文件

在/usr/hadoop目录中设置文件夹结构如下:
随后建立两个文本文件:file1.txt和file2.txt。
其中(file1.txt)的内容设为"Hello World

全部评论 (0)

还没有任何评论哟~