Advertisement

Hadoop MapReduce 05

阅读量:

MapReduce1.0

为何命名为MapReduce?

其核心操作为:map + reduce

将输入的(格式化k,v)数据集经过映射处理,生成一个中间阶段的(k,v)数据集,再通过reduce进行处理(类似sql操作)

对于具有相同key的数据集合,会触发一次reduce方法调用,在该方法内部对这一组数据进行循环处理(类似于sql语句的操作)

排序

比较

遍历

计算

不同维度下的开销,如音乐及其他方面

MapReduce由MapTask与ReduceTask构成

以单词统计为例(后续将单独进行详细说明):

block > split

1:1

N:1

1:N

split > map

1:1

map > reduce

N:1

N:N

1:1

1:N

group(key)>partition

1:1

N:1

N:N

1:N? >违反原始语义结构

p

全部评论 (0)

还没有任何评论哟~