学习大数据中的Hive技术
发布时间
阅读量:
阅读量
**
一、Hive介绍
Hive官网:https://hive.apache.org/
1.1 hive简介
Hive作为一款数据仓库基础工具,被应用于Hadoop平台中,用于处理结构化数据。其架构建立在Hadoop之上,归类于大数据技术范畴,并使得查询与分析操作更为便捷。同时,它提供了简易的SQL查询功能,能够将SQL语句转换为MapReduce任务进行执行。
最初,Hive由Facebook团队开发,并随后交由Apache软件基金会继续维护,最终以Apache Hive之名成为一个开源项目。Hive本身并不具备特定的数据格式要求。它能够良好地运行于Thrift之上,并支持控制分隔符的功能,同时也允许用户自行定义数据格式。然而,Hive并不适用于在线事务处理场景。其最适宜的应用领域是传统意义上的数据仓库任务。
Hive构建于基于静态批处理的Hadoop框架之上,而Hadoop通常存在较高的延迟,并且在作业提交和调度过程中需要较大的资源开销。因此,在大规模数据集上实现低延迟、快速查询的能力受到限制。例如,在几百MB规模的数据集上执行查询时,一般会出现分钟级的时间延迟。因此,
Hive并不适合那些对响应时间有较高要求的应用场景,例如联机事务处理(OLTP)。在执行查询操作时,Hive严格遵循Hadoop MapReduce的作业执行模型。具体而言,用户
全部评论 (0)
还没有任何评论哟~
