Hive _分桶及抽样查询
发布时间
阅读量:
阅读量
分桶及抽样查询
1、分桶表数据存储
【分区主要涉及数据的存储路径设置;而分桶则关注数据文件的划分方式。
分区为实现数据隔离以及查询效率优化提供了一种便捷手段。然而,并非所有类型的数据集都适合进行有效的分区操作,尤其是在确定合理的划分粒度方面仍存在一定的挑战。
分桶作为一种技术手段,能够将庞大的数据集进一步拆分为更易于处理和管理的多个子集。
hive (default) > show databases;
OK
database_name
default
Time taken: 1.092 seconds, Fetched: 1 row(s)
**hive (default) > create table stu_buck(id int, name string)
clustered by(id)
into 4 buckets
row format delimited fields terminated by '\t';**
OK
Time taken: 0.443 seconds
hive (default) > desc formatted stu_buck;
OK
col_name data_type comment
全部评论 (0)
还没有任何评论哟~
