Advertisement

RDD分区切片生成及基于代码对分区中的数据进行解析

阅读量:
复制代码
    Desc:通过读取外部文件的方式创建RDD的分区规则
    -在textFile中,第二个参数为minPartitions表示最小分区数,注意是最小,不是实际最终磅定的分区数
    -在实际分区的过程中,会根据处理的文件的总大小(字节数)初最小分区数进行相除运算
    >余数为0,那么最小分区数,就是实际的分区数
    >余数不为0,那么实际分区数  大于  最小分区数
    
    val rdd: RDD[String] = sc.textFile("input", 3)
    
    
    AI写代码scala
复制代码
    //minPartitions表示最小分区数
    def textFile(
      path: String,  //路径
      minPartitions: Int = defaultMinPartitions): RDD[String] = withScope {
    assertNotStopped()
    hadoopFile(path, classOf[TextInputFormat], classOf[LongWritable], classOf[Text],
      minPartitions).map(pair => pair._2.toString).setN

全部评论 (0)

还没有任何评论哟~