《MapReduce基础整理》(三) shuffle机制、MapJoin、ReduceJoin及倒排序索引
发布时间
阅读量:
阅读量
目录
- 1. Mapreduce的Shuffle机制
-
- 1.1 概述
- 1.2 Shuffle机制分析
-
- 1.2.1 核心处理流程
- 1.2.2 环形内存缓冲区
- 1.2.3 具体执行过程
-
2. Map Join与Reduce Join技术
-
- 2.1 数据表连接方式
- 2.2 Reduce端连接方法
- 2.3 Map端连接策略
- 2.4 基于Hadoop平台的倒排索引实现
-
1. Mapreduce的Shuffle机制
1.1概述
一个MapReduce流程:
map——>shuffle(排序、分组、分区、combiner)——>reduce
- 在MapReduce框架中,mapper阶段所处理的数据如何传输至reducer阶段,构成了整个系统最为核心的环节,这一过程被称作Shuffle
- Shuffle:即数据混洗——其核心机制包括数据分区、排序、局部聚合、缓存、拉取以及再次合并排序
- 更具体地讲,这一过程指的是将MapTask所产生的处理结果,依据Partitioner组件设定的规则分发至对应的ReduceTas
全部评论 (0)
还没有任何评论哟~
