MapReduce 是分布式计算框架
发布时间
阅读量:
阅读量
文章结构概览
- 1.MapReduce的分区与ReduceTask的数量
-
- Shuffle阶段的Partition分区算法
- 首要步骤:设定mapper模块
- 次要步骤:构建reducer处理逻辑
- 第三步骤:设计自定义的partitioner组件
- 最后步骤:编写程序的主函数入口
-
2.MapReduce中的计数器机制
-
3.MapReduce中的combiner组件
-
4.MapReduce综合实践之网络流量统计
- 要求一:完成流量数据的累加计算
- 要求二:实现上行流量按从高到低的排序方式
- 要求三:根据手机号码进行数据分组处理
-
1.MapReduce的分区与ReduceTask的数量
在MapReduce框架中,通过设定特定的分区规则,能够将属于同一分区的数据传输至对应的reduce任务中。例如,在进行数据统计时,可以将具有相似特征的一组数据集中发送至同一个reduce任务中,从而在该任务内部对同类数据进行统计与处理,实现数据的分类与汇总功能。简而言之,即对相同类别的数据进行归并处理,统一交由reduce阶段执行。默认情况下,reduce的分区数量仅设置为一个。
MapReduce中的分区类图
