大数据-计算引擎-Spark(四):原生Spark(基于Scala)、PySpark(基于Python API调用底层 Scala 代码)对比
发布时间
阅读量:
阅读量
一、Spark计算框架介绍
Spark是由加州大学伯克利分校AMP实验室开发并开源的一种通用并行计算框架,其设计灵感来源于Hadoop MapReduce。该框架不仅继承了Hadoop MapReduce的优势,还具备独特之处,即在执行任务过程中能够将中间结果存储于内存中,从而避免频繁读写HDFS,显著提升了处理效率。这一特性使得Spark在数据挖掘和机器学习等需要多次迭代计算的场景中表现出色。
与Hadoop相似,Spark同样是一种开源的集群计算环境,但二者之间存在若干关键差异。这些差异赋予了Spark在特定类型的工作负载上更优的表现。例如,Spark引入了内存分布数据集的概念,在提供交互式查询功能的同时,还能有效优化需要反复计算的任务流程。
该框架基于Scala语言构建,并以Scala作为其应用程序开发的主要框架。相较于Hadoop,Spark与Scala之间实现了高度集成,用户可以如同操作本地集合对象一般便捷地处理分布式数据集。
从底层实现来看,Spark采用Scala和Java编写,并已支持多种编程语言接口供用户调用和操作,包括Python和R语言等。
二、原生Spark、Pyspark性能对比
1、准备工作
- 获取Scala安装包,并在IDEA开发环境中搭建Maven项目框架,集成Scala的SDK开发工具包及相关依赖库
全部评论 (0)
还没有任何评论哟~
