Advertisement

HIVE中的MAP与REDUCE数目

阅读量:

一、总览MR执行过程

MapReduce程序通常会遵循以下步骤:首先接收输入数据并将其划分为多个片块;随后依次执行映射处理阶段、中间整理阶段以及归约处理阶段;最终生成最终结果。

无需赘言的是事实。数据通常会存储在HDFS上,并且会被分割成多个块。此外,在输入分片中需要说明的是文件块与文件分片之间的关系。

在Map阶段之前,在MapReduce框架运行时会自动完成对原始数据的预处理工作:计算并生成所有必要的input splits(即input分片)。每个input split都会被分配给单独的Map任务来进行处理。这些input splits通常与HDFS中的块高度相关。例如,在HDFS中,默认情况下每个块被设置为128MB大小;当我们有两个文件分别大小为27MB和129MB时,则第一个文件会被视为单个input split(因为其小于默认值),而第二个文件则会被分割成两个input split(剩余部分即使只有1MB也被视为独立的一个split)。Splitting对应的三个数据即代表三个input splits

3、Map阶段:在该阶段中涉及编写好的Map函数处理逻辑。

全部评论 (0)

还没有任何评论哟~