spark进阶(四):RDD使用
发布时间
阅读量:
阅读量
Spark构建了一种用于数据处理的核心抽象模型,即弹性分布式数据集(Resilient Distributed Dataset,RDD)。该数据集合的全部或部分内容可以被存储于内存中,并在多次计算过程中重复利用。本质上,RDD是一种分布于多个计算节点上的数据集合。
RDD具备以下主要特性:
- RDD具有不可变性,但可以通过转换操作生成新的RDD以实现进一步处理。
- RDD支持分区功能。其内部由多个分区构成,每个分区对应一个独立的Task任务进行处理(关于分区的具体内容将在3.4节中详细阐述)。
- 对RDD执行任何操作,实际上等同于对其中的每一个分区进行相应处理。
- RDD提供了一系列用于对分区执行计算的函数,这些函数被称为算子(有关算子的详细介绍将在3.3节中展开说明)。
- 各个RDD之间存在依赖关系,这种依赖机制能够实现流水线式的处理流程,从而有效避免了中间结果的存储需求。
一、测试数据说明
广为人知的电影推荐相关数据集:MovieLen,其官方网址为https://grouplens.org/datasets/movielens/。
本次实验中采用的是规模较小的数据集以进行测试,相关逻辑已编写完成,后续可进一步尝试应用至更大规模的数据集上。

还没有任何评论哟~
