Hive程序开发和维护规范
发布时间
阅读量:
阅读量
一、开发规范制定与实施
- 单条SQL语句的长度应控制在单屏显示范围内
- SQL语句中子查询的嵌套层级不应超过三层
- 尽量避免使用hint相关指令
- 当存在多个逻辑相同的代码段时,可将执行结果保存至临时表中以便复用
- 尽可能利用SQL内置的高级功能进行操作,例如,在进行多维统计分析时,可使用cube、grouping sets及rollup等命令替代多个子句通过union all连接的操作
- 在修改配置命令时,应通过set属性进行设置,并添加相应的注释说明
- 代码中禁止出现对表、分区或列的DDL语句,仅允许新增或删除分区操作
Hive SQL更适用于处理包含多条数据的数据集,不适用于处理单条数据,并且当单条数据之间存在顺序依赖关系时表现不佳。例如,假设有A、B、C三条数据记录,若只有A满足特定条件后才能处理B行数据,并且仅当A和B同时满足条件时才可处理C行,则Hive SQL无法有效支持此类逻辑关系 - 确保每个查询语句所涉及的表类型保持一致。例如,在一个SQL语句中所使用的表均应为ORC格式或者均为parquet格式
- 注意对null值相关数据的处理方式
- 当存在多层嵌套结构时,内层嵌套表中的过滤条件不应被移至外层进行处理
例如
select a.* from a
全部评论 (0)
还没有任何评论哟~
