Advertisement

Hadoop编程小技巧(1)---Map端聚合

阅读量:

测试hadoop版本:2.4

Map端聚合的应用场景主要适用于关注特定范围内的关键信息的情况,并且该方法要求处理的数据量较小且无需外部存储支持

使用的好处:可以大大减小网络数据的传输量,提高效率;

大致流程:使用Mapper的map函数收集全部数据后,并将其存储于列表中。随后,在cleanup函数期间执行特定操作以优化该列表,并输出所需的数据。

实例:

在map函数中通过空格分割每行数据,并将每个词依次压入一个栈结构,在cleanup函数中返回该栈结构中最频繁出现的词及其出现频率;

复制代码
 package fz.inmap.aggregation;

    
  
    
 import java.io.IOException;
    
 import java.util.ArrayList;
    
 import java.util.PriorityQueue;
    
  
    
 import org.apache.hadoop.conf.Configuration;
    
 import org.apache.hadoop.conf.Configured;
    
 import org.apache.hadoop.fs.Path;
    
 import org.apache.hadoop.io.IntWritable;
    

全部评论 (0)

还没有任何评论哟~