入门Hadoop WordCount程序
发布时间
阅读量:
阅读量
入门Hadoop的WordCount程序
本文主要阐述两大内容:一是概述性介绍MapReduce的运行机制;二是深入解析WordCount程序。
1. MapReduce的工作原理
在《Hadoop in action》这本著作中对该计算模型进行了详实的阐述,在此我们直接引用了该书关于这一计算模型的相关内容
“
在Hadoop生态系统中负责处理MapReduce作业的任务节点有两种类型:一种称为JobTracker节点;另一种称为TaskTracker节点。其中 JobTracker 节点主要负责调度MapReduce作业的流程;而 TaskTracker 节点则具体处理数据的读取与计算。一个完整的 Hadoop 集群内部通常只配置了一台 JobTracker 节点以确保系统的高效运行。
在分布式计算领域中,在《MapReduce》框架下承担了并行编程中面临的分布式存储、工作调度、负载均衡等技术难题,并将其简化为两个核心功能模块:大作业划分与整合管理。其中,《map》函数将大作业划分成多个子作业,并对这些子作业进行整合管理,《reduce》函数则对整合后结果进行综合分析作为最终输出结果返回给主程序。
在 Hadoop 环境中每个 MapReduce 任务都会被初始化为一个特定的 Job 对象 每个这样的 Job 又会被分解为两个主要阶段 即 map 阶
全部评论 (0)
还没有任何评论哟~
