Advertisement

SparkSQL概述、六种常用数据类型用于创建DataFrame的方式以及三类功能

阅读量:

SparkSQL概述、6种不同数据格式创建DataFream方式、3种函数

一、SparkSQL简述

SparkSQL的起源与发展

Hive到Shark再到SparkSQL的演进过程

Shark实现了Hive在Spark上的运行,此时Hive不仅承担数据存储功能,还负责SQL语句的解析与优化,而Spark则主要负责任务的执行环节

SparkSQL则是将Hive与Spark进行深度整合后的产物,在该架构中,Hive仅作为数据存储的载体,而SQL的解析、优化以及执行任务均由Spark独立完成

SparkSQL技术方案的核心动因在于彻底摆脱对Hive的依赖,实现系统架构层面的解耦

SparkSQL核心特性解析

SparkSQL具备对Hive与Shark语法的全面兼容性

SparkSQL能够执行针对原生RDD的查询操作。RDD作为Spark平台中的核心组件,构成了其高效处理各类大数据场景的基础

可在Scala语言环境中编写SQL语句,并提供基础的SQL语法校验功能。同时支持在Scala中使用Hive语句访问Hive数据源,并将获取的结果以RDD形式返回,例如:df.rdd以及val age: Long = row.getAs[Long] (“age”)

采用DataFrame这一分布式数据容器进行数据处理

全部评论 (0)

还没有任何评论哟~