Advertisement

Hadoop/MapReduce 链式实践--ChainReducer

阅读量:

版本:CDH5.0.0,HDFS:2.3.0,Mapreduce:2.3.0,Yarn:2.3.0。

场景描述:求一组数据中按照不同类别的最大值,比如,如下的数据:

data1:

复制代码
    A,10
    A,11
    A,12
    A,13
    B,21
    B,31
    B,41
    B,51
    
    plain

data2:

复制代码
    A,20
    A,21
    A,22
    A,23
    B,201
    B,301
    B,401
    B,501
    
    plain

最后输出为:

复制代码
    A,23
    B,501
    
    plain

假如这样的逻辑的mapreduce数据流如下:

假定C组的数据量较大,则在这样一个场景下(即集群包含两个计算节点的情况下),该任务应分配给两个不同的reducers角色;这些较大的数据集会被平均分配至两个不同的reducers上;这样一来(即通过这种方式实现负载均衡),当单个节点执行Reduce

全部评论 (0)

还没有任何评论哟~