RDD分区切片生成及基于代码对分区中的数据进行解析
发布时间
阅读量:
阅读量
Desc:通过读取外部文件的方式创建RDD的分区规则
-在textFile中,第二个参数为minPartitions表示最小分区数,注意是最小,不是实际最终磅定的分区数
-在实际分区的过程中,会根据处理的文件的总大小(字节数)初最小分区数进行相除运算
>余数为0,那么最小分区数,就是实际的分区数
>余数不为0,那么实际分区数 大于 最小分区数
val rdd: RDD[String] = sc.textFile("input", 3)
AI写代码scala
//minPartitions表示最小分区数
def textFile(
path: String, //路径
minPartitions: Int = defaultMinPartitions): RDD[String] = withScope {
assertNotStopped()
hadoopFile(path, classOf[TextInputFormat], classOf[LongWritable], classOf[Text],
minPartitions).map(pair => pair._2.toString).setN
全部评论 (0)
还没有任何评论哟~
