Advertisement

《MapReduce基础整理》(三) shuffle机制、MapJoin、ReduceJoin及倒排序索引

阅读量:

目录

  • 1. Mapreduce的Shuffle机制
      • 1.1 概述
      • 1.2 Shuffle机制分析
        • 1.2.1 核心处理流程
        • 1.2.2 环形内存缓冲区
        • 1.2.3 具体执行过程
    • 2. Map Join与Reduce Join技术

      • 2.1 数据表连接方式
      • 2.2 Reduce端连接方法
      • 2.3 Map端连接策略
      • 2.4 基于Hadoop平台的倒排索引实现

【MapReduce】Mapreduce基础知识整理(一)

1. Mapreduce的Shuffle机制

1.1概述

一个MapReduce流程:
map——>shuffle(排序、分组、分区、combiner)——>reduce

  1. 在MapReduce框架中,mapper阶段所处理的数据如何传输至reducer阶段,构成了整个系统最为核心的环节,这一过程被称作Shuffle
  2. Shuffle:即数据混洗——其核心机制包括数据分区、排序、局部聚合、缓存、拉取以及再次合并排序
  3. 更具体地讲,这一过程指的是将MapTask所产生的处理结果,依据Partitioner组件设定的规则分发至对应的ReduceTas

全部评论 (0)

还没有任何评论哟~