1.2 离线数仓:数据仓库环境准备
发布时间
阅读量:
阅读量
离线数仓—数据仓库环境准备
- 引言
-
一、数据仓库运行环境
-
- 1.Hive运行环境构建
-
- 1.1 Hive处理引擎概述
- 1.2 Hive与Spark集成配置
- 1.3 Yarn运行环境设置
-
二、数据仓库开发环境配置
-
- 1. DataGrip软件安装与应用
- 1.1 DataGrip操作指南
- 1.2 DataGrip功能测试与验证
-
三、数据仓库模拟数据生成
-
- 1 用户行为日志生成准备
- 2 相关业务数据生成准备
-
前言
在数仓设计工作完成后,当前阶段需着手数据仓库环境的搭建,具体涵盖运行环境配置、开发环境构建以及模拟数据的生成与准备。
一、数据仓库运行环境
数仓运行环境指的是Hive在整个流程调度过程中所依赖的具体执行条件与背景设置。
1.Hive环境搭建与配置
1.1 Hive引擎简介
Hive引擎涵盖以下几种类型:默认的MR引擎、Tez引擎以及Spark引擎。
Hive on Spark模式中,Hive不仅承担着元数据存储的功能,还负责对SQL语句进行解析与优化,其语法采用的是HQL语法,而执行过程则交由Spark完成,Spark通过RDD机制实现任务执行。
在Spark on
全部评论 (0)
还没有任何评论哟~
