Advertisement

Hive的simple partition和bucket/bucket bin的理解

阅读量:

一、Hive分区。
是指按照数据表的某列或某些列分为多个区,区从形式上可以理解为 文件夹

例如我们计划获取一个大型网站的日志记录。同一个网站每天生成的日志信息存储在同一个数据库表中。然而因为每天会产生成千上万条日志记录所以该数据表的空间会变得非常庞大执行全范围查询将会消耗大量计算资源。实际上在这种情况下我们可以根据日期将数据库索引分为不同的区间段当用户指定特定时间段字段后系统可以直接定位到对应的区间段执行查询操作。

常用的分区字段都是按照时间来区分。

复制代码
 #创建分区表

    
 create table t1 (
    
 id int comment '编号',
    
 name string comment '姓名',
    
 age int comment' 年龄'
    
 )
    
 partitioned by (pdate string)
    
 row format delimited fields terminated by '\001'
    
 ;
    
  
    
 常用命令:
    
 查看分区数据:
    
 select * from t1 where pdate='2020-01-01';
    
  
    
 查看有哪些分区:
    
 show partitions t1;

全部评论 (0)

还没有任何评论哟~