Hadoop编程小技巧(1)---Map端聚合
发布时间
阅读量:
阅读量
测试hadoop版本:2.4
Map端聚合的应用场景主要适用于关注特定范围内的关键信息的情况,并且该方法要求处理的数据量较小且无需外部存储支持
使用的好处:可以大大减小网络数据的传输量,提高效率;
大致流程:使用Mapper的map函数收集全部数据后,并将其存储于列表中。随后,在cleanup函数期间执行特定操作以优化该列表,并输出所需的数据。
实例:
在map函数中通过空格分割每行数据,并将每个词依次压入一个栈结构,在cleanup函数中返回该栈结构中最频繁出现的词及其出现频率;
package fz.inmap.aggregation;
import java.io.IOException;
import java.util.ArrayList;
import java.util.PriorityQueue;
import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.conf.Configured;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.IntWritable;
全部评论 (0)
还没有任何评论哟~
