Spark RDD 依赖与血缘关系
发布时间
阅读量:
阅读量
文章目录
- Spark—RDD依赖与血缘关联
-
- 1、RDD 血缘关联
- 2、RDD 依赖关联
- 3、窄依赖
- 4、宽依赖
- 5、宽窄依赖图示
- 6、RDD 阶段划分方式
- 7、RDD 任务划分方法
-
Spark RDD依赖与血缘关系分析
1、RDD 血缘关系
RDD 仅适用于粗粒度的数据转换操作,这类操作通常作用于大规模数据集中的整体记录。在生成 RDD 的过程中,会保存一系列 Lineage(血统)信息,用于在数据分区丢失时进行恢复。Lineage 记录了与 RDD 相关的元数据及转换过程,一旦出现部分数据分区缺失的情况,系统便可依据这些记录重新计算并恢复相应的数据分区。
val fileRDD: RDD[String] = sc.textFile("input/1.txt")
println(fileRDD.toDebugString)
println("----------------------")
val wordRDD: RDD[String] = fileRDD.flatMap(_.split(" "))
println(wordRDD.toDebugString)
prin
全部评论 (0)
还没有任何评论哟~
