Hadoop MapReduce 05
发布时间
阅读量:
阅读量
MapReduce1.0
为何命名为MapReduce?
其核心操作为:map + reduce
将输入的(格式化k,v)数据集经过映射处理,生成一个中间阶段的(k,v)数据集,再通过reduce进行处理(类似sql操作)
对于具有相同key的数据集合,会触发一次reduce方法调用,在该方法内部对这一组数据进行循环处理(类似于sql语句的操作)
排序
比较
遍历
计算
不同维度下的开销,如音乐及其他方面
MapReduce由MapTask与ReduceTask构成
以单词统计为例(后续将单独进行详细说明):


block > split
1:1
N:1
1:N
split > map
1:1
map > reduce
N:1
N:N
1:1
1:N
group(key)>partition
1:1
N:1
N:N
1:N? >违反原始语义结构
p
全部评论 (0)
还没有任何评论哟~
