Hadoop/MapReduce 链式实践--ChainReducer
发布时间
阅读量:
阅读量
版本:CDH5.0.0,HDFS:2.3.0,Mapreduce:2.3.0,Yarn:2.3.0。
场景描述:求一组数据中按照不同类别的最大值,比如,如下的数据:
data1:
A,10
A,11
A,12
A,13
B,21
B,31
B,41
B,51
plain
data2:
A,20
A,21
A,22
A,23
B,201
B,301
B,401
B,501
plain
最后输出为:
A,23
B,501
plain
假如这样的逻辑的mapreduce数据流如下:

假定C组的数据量较大,则在这样一个场景下(即集群包含两个计算节点的情况下),该任务应分配给两个不同的reducers角色;这些较大的数据集会被平均分配至两个不同的reducers上;这样一来(即通过这种方式实现负载均衡),当单个节点执行Reduce
全部评论 (0)
还没有任何评论哟~
