Advertisement

MapReduce 是分布式计算框架

阅读量:

文章结构概览

  • 1.MapReduce的分区与ReduceTask的数量
      • Shuffle阶段的Partition分区算法
      • 首要步骤:设定mapper模块
      • 次要步骤:构建reducer处理逻辑
      • 第三步骤:设计自定义的partitioner组件
      • 最后步骤:编写程序的主函数入口
    • 2.MapReduce中的计数器机制

    • 3.MapReduce中的combiner组件

    • 4.MapReduce综合实践之网络流量统计

      • 要求一:完成流量数据的累加计算
      • 要求二:实现上行流量按从高到低的排序方式
      • 要求三:根据手机号码进行数据分组处理

1.MapReduce的分区与ReduceTask的数量

在MapReduce框架中,通过设定特定的分区规则,能够将属于同一分区的数据传输至对应的reduce任务中。例如,在进行数据统计时,可以将具有相似特征的一组数据集中发送至同一个reduce任务中,从而在该任务内部对同类数据进行统计与处理,实现数据的分类与汇总功能。简而言之,即对相同类别的数据进行归并处理,统一交由reduce阶段执行。默认情况下,reduce的分区数量仅设置为一个。
MapReduce中的分区类图

![在这里

全部评论 (0)

还没有任何评论哟~