PySpark生成Dataframe的三种方法总结
发布时间
阅读量:
阅读量
为何选择使用Spark的DataFrame : Spark中DataFrame与Pandas中DataFrame的区别
在Spark 1.3版本中引入了DataFrame这一概念。它可被视作一种数据集,以命名列的形式进行组织。DataFrame类似于R语言或Python中所使用的数据框架,或者关系型数据库中的表格结构。可以将其描述为具备优良优化机制的关系型表格。设计DataFrame的核心理念在于支持大规模结构化数据的处理能力 。该结构由具有Schema模型定义的行组成。
相较于RDD,DataFrame具有明显优势,同时又继承了RDD的部分功能特性。RDD与DataFrame共有的特征包括不可变性、内存中的弹性以及分布式计算能力。其优势在于允许用户对分布式数据集合施加结构约束,从而实现更高层次的抽象表达。
DataFrame能够从多种数据源构建而成,例如结构化的数据文件、Hive表、外部数据库或现有的RDD。针对DataFrame的应用程序编程接口(API),提供了多语言版本的支持。
选择DataFrame的原因
DataFrame相较于RDD具有更明显的优势。这主要得益于其具备的内存管理机制以及优化后的执行策略,而RDD则缺乏内置的优化引擎,也无法对结构化数据进行规范化处理。
基于上述需求,DataFrame应运而生,其核心功能包括:
全部评论 (0)
还没有任何评论哟~
