Advertisement

MapReduce的基本流程包括映射和归约过程

阅读量:

MapReduce被视作解锁大数据算法的关键工具,本文将对MapReduce的基本运作机制进行简要阐述。

MapReduce的核心理念与架构

在古代,人们砍伐了大量木材,需要马匹来运输。然而,当木材数量庞大时,仅依靠一匹马显然无法胜任,此时选择一匹更强壮的马来运输并不是最优解,而是会采用多匹马协同运输的方式;同样地,在处理大数据时也遵循这一原理。超级计算机并非最佳方案,“分而治之”才是更优策略,这正是MapReduce所秉持的核心思想之一。

Hadoop 1.0版本中的MapReduce计算框架(MRv1)采用Master/Slave(主/从)架构设计,如图所示,其主要由四个组件构成:JobTracker、TaskTracker、Client和Task。MRv1计算框架的基本理念是将任务抽象为两个阶段——即Map阶段和Reduce阶段。第一阶段也被称为分解映射阶段,在此阶段中输入数据首先会被拆分为键值对形式,并通过反复迭代后由map函数进行处理,最终仍以键值对形式输出至本地磁盘;第二阶段则称为合并规约阶段,在该阶段中会根据相同键对应的值进行归并处理,并将最终结果输出至HDFS系统。其数据处理引擎包含两个部分:Map Task与Reduce Task,前者负责执行Map阶段的逻辑操作,后者则承担Reduce阶段的逻辑操作。运行环境方面亦分为两部分:JobTracker(

全部评论 (0)

还没有任何评论哟~