Advertisement

数据研发

阅读量:

一、Hive和Mysql的区别

二、hadoop和spark的区别

Hadoop主要包含两大核心组件:分布式文件存储系统HDFS和并行处理框架Mapreduce。

2、Spark并未内置分布式文件存储系统,并且spark的数据分析工作主要依靠Hadoop的分布式文件系统HDFS

在数据计算方面,Hadoop的Mapreduce与spark都具备能力,相较于Mapreduce,spark不仅运算速度更快,而且提供的功能也更为全面。

三、hive

Hive是建立在 Hadoop 上的数据仓库基础构架。

Hive的几个特点

Hive的核心优势在于通过类SQL实现大数据分析,并非必须手动编写MapReduce程序以完成数据处理工作

数据是存储在HDFS上的,Hive本身并不提供数据的存储功能

Hive是一种用于将数据转换为存储结构中多个表格的方法;在存储结构中存储库及其相关元数据信息的一般位置通常与传统关系型数据库如MySQL相关。

数据存储方面:该系统能够高效地存储海量数据集,并无需过分关注数据的完整性和格式规范

在数据处理方面:由于Hive语句最终会导致生成MapRedu

全部评论 (0)

还没有任何评论哟~