-Hive-
发布时间
阅读量:
阅读量
Hive定义
该技术被定义为一种数据分析平台,在分布式计算环境中实现对海量数据的高效处理与管理。该平台不仅支持传统的结构化数据存储与检索功能,并且能够处理来自各种来源的非结构化信息;其架构基于Hadoop生态系统中的关键组件(如HDFS和MapReduce),旨在提供强大的工具来进行结构化与非结构化数据的处理与分析。
- 使用HQL(类SQL语句)作为查询接口;
- 使用HDFS作为底层存储;
- 使用MapReduce作为执行层,即将HQL语句转译成M/R Job然后在Hadoop执行
Hive的表其实就是HDFS的目录/文件夹,按表名把文件夹分开。如果是分区表,则分区值是子文件夹;
Hive概述—元数据、数据、目录
-
元数据信息存储在DB(Derby/MySQL)中。
- 包含表名称、列名以及分区属性等详细信息。
- 每个表都有元数据信息一栏,在此栏中会列出该表是否是外部表等相关设置项。
- 数据所在的目录位置也有所规定;数据位于集群目录下:
- 内部表:/user/hive/warehouse/表名;
- 外部表:用户自定的目录;
-
表中的数据相当于将每个字段存储在对应的文件夹中;
-
上传的文件相当于将这些信息导入到数据库中的特定表格;
-
因此,在实际应用中,一个数据库通常会包含多个这样的文件;
全部评论 (0)
还没有任何评论哟~
