Advertisement

Spark RDD 依赖与血缘关系

阅读量:

文章目录

  • Spark—RDD依赖与血缘关联
      • 1、RDD 血缘关联
      • 2、RDD 依赖关联
      • 3、窄依赖
      • 4、宽依赖
      • 5、宽窄依赖图示
      • 6、RDD 阶段划分方式
      • 7、RDD 任务划分方法

Spark RDD依赖与血缘关系分析

1、RDD 血缘关系

RDD 仅适用于粗粒度的数据转换操作,这类操作通常作用于大规模数据集中的整体记录。在生成 RDD 的过程中,会保存一系列 Lineage(血统)信息,用于在数据分区丢失时进行恢复。Lineage 记录了与 RDD 相关的元数据及转换过程,一旦出现部分数据分区缺失的情况,系统便可依据这些记录重新计算并恢复相应的数据分区。

复制代码
    val fileRDD: RDD[String] = sc.textFile("input/1.txt")
    println(fileRDD.toDebugString)
    println("----------------------")
    val wordRDD: RDD[String] = fileRDD.flatMap(_.split(" "))
    println(wordRDD.toDebugString)
    prin

全部评论 (0)

还没有任何评论哟~