SparkSQL概述、六种常用数据类型用于创建DataFrame的方式以及三类功能
发布时间
阅读量:
阅读量
SparkSQL概述、6种不同数据格式创建DataFream方式、3种函数
一、SparkSQL简述
SparkSQL的起源与发展
Hive到Shark再到SparkSQL的演进过程
Shark实现了Hive在Spark上的运行,此时Hive不仅承担数据存储功能,还负责SQL语句的解析与优化,而Spark则主要负责任务的执行环节
SparkSQL则是将Hive与Spark进行深度整合后的产物,在该架构中,Hive仅作为数据存储的载体,而SQL的解析、优化以及执行任务均由Spark独立完成
SparkSQL技术方案的核心动因在于彻底摆脱对Hive的依赖,实现系统架构层面的解耦
SparkSQL核心特性解析
SparkSQL具备对Hive与Shark语法的全面兼容性
SparkSQL能够执行针对原生RDD的查询操作。RDD作为Spark平台中的核心组件,构成了其高效处理各类大数据场景的基础
可在Scala语言环境中编写SQL语句,并提供基础的SQL语法校验功能。同时支持在Scala中使用Hive语句访问Hive数据源,并将获取的结果以RDD形式返回,例如:df.rdd以及val age: Long = row.getAs[Long] (“age”)
采用DataFrame这一分布式数据容器进行数据处理
全部评论 (0)
还没有任何评论哟~
