Hive的数据分布、优化方案、Hive运行流程及垃圾回收
发布时间
阅读量:
阅读量
文章目录
-
数据分析中的"偏斜"现象
-
问题定义:请阐述什么是"偏斜"?
- 常见问题案例:哪些情形容易导致偏斜?
- 形成原因分析:造成偏斜的因素有哪些?
- 避免偏斜条件:哪些情况下不会出现偏斜?
- 应用场景概述:在哪些实际场景中会遇到偏斜问题?
- 字段缺失引发的偏斜:当关键字段缺失时如何处理?
- 不同字段类型相关联的影响:不同类型的字段相互关联如何影响结果?
- 规模差异的表之间关联查询的影响:在规模差异较大的表之间进行关联查询时需要注意什么?
- 字段缺失引发的偏斜:当关键字段缺失时如何处理?
-
2. hive执行过程实例分析
-
- 2.1 Hive 操作符列表
- 2.2 Hive 编译器的工作职责
- 2.3 优化器类型
- 2.4 hive查看执行过程
- 2.5 几个常用语句的MR转换
-
- join
- group by
- distinct
-
-
3. Hive 优化策略
-
- 3.1 Hadoop 框架计算特性
-
- 3.2 常用优化手段
-
- 3.3 排序方式的选择
-
- 3.4 笛卡尔积操作
-
- 3.5 in/exists 语句的应用
-
全部评论 (0)
还没有任何评论哟~
