Hadoop 学习路线第九课:分析数据分布不均的原因及解决方案(附详细代码)
发布时间
阅读量:
阅读量
内容简介
-
- 一、数据倾斜概述
-
-
- 1. 数据倾斜的定义
-
-
2. 导致数据倾斜的因素
-
二、应对数据倾斜的策略
-
-
- 1. 对分区类进行重新设计
-
-
2. 对Key进行重新设定
-
三、代码实现示例
-
-
-
- 创建Java项目并配置Maven支持
-
-
-
2. 对分区类进行重新设计的代码展示
-
- (1). 第一阶段任务
- (2). 第二阶段任务
-
3. 对Key重新设定的代码展示
-
- (1). 第一阶段任务
- (2). 第二阶段任务
-
四、总结分析
-
- 一、数据倾斜概述
一、数据倾斜概述
1. 什么是数据倾斜
在借助Hadoop开展数据处理任务时,数据倾斜现象时常发生。所谓数据倾斜,指的是在WordCount程序的Map阶段存在一个分区操作,具有相同Key的数据会被归类至同一分区,而该分区内的所有Key将在Shuffle阶段被传输至同一个Reduce节点进行聚合运算。然而,这一流程中存在潜在问题:若某一特定Key的数据量极大,例如达到100G,则这些数据最终将集中于单一Reduce节点进行处理,从而对该节点造成极大的计算压力,这种情况即为数据倾斜。
2. 数据倾斜的成因
全部评论 (0)
还没有任何评论哟~
