Advertisement

spark进阶(四):RDD使用

阅读量:

Spark构建了一种用于数据处理的核心抽象模型,即弹性分布式数据集(Resilient Distributed Dataset,RDD)。该数据集合的全部或部分内容可以被存储于内存中,并在多次计算过程中重复利用。本质上,RDD是一种分布于多个计算节点上的数据集合。

RDD具备以下主要特性:

  • RDD具有不可变性,但可以通过转换操作生成新的RDD以实现进一步处理。
  • RDD支持分区功能。其内部由多个分区构成,每个分区对应一个独立的Task任务进行处理(关于分区的具体内容将在3.4节中详细阐述)。
  • 对RDD执行任何操作,实际上等同于对其中的每一个分区进行相应处理。
  • RDD提供了一系列用于对分区执行计算的函数,这些函数被称为算子(有关算子的详细介绍将在3.3节中展开说明)。
  • 各个RDD之间存在依赖关系,这种依赖机制能够实现流水线式的处理流程,从而有效避免了中间结果的存储需求。

一、测试数据说明

广为人知的电影推荐相关数据集:MovieLen,其官方网址为https://grouplens.org/datasets/movielens/。

本次实验中采用的是规模较小的数据集以进行测试,相关逻辑已编写完成,后续可进一步尝试应用至更大规模的数据集上。

![image-20211006100225455](https://cdl.ita

全部评论 (0)

还没有任何评论哟~