Advertisement

研究 Spark TextFille 的分区与计算策略

阅读量:

几种比较常见的RDD

在常规开发过程中, 我们通常会频繁地使用以下几种 RDD 在这些场景下, textFile 类型的数据随机存取存储(DDS)是基础组件之一 它是基于文本文件进行处理并生成的一种数据结构 JDBCRDD 类型是基于关系型数据库进行数据读取并生成 DDS 对象 HBase RDD 类别则是以 HBase 数据库为基础, 实现数据读写功能 sequenceFile 类型的数据随机存取存储(DDS)则依赖于序列化文件来进行处理

我会按照一定顺序分析每种RDD的情况,并着重结合 RDD 五大特性中的分区与计算策略,在代码实现中添加详细的注释以提高可读性

分区流程

从SparkContext中的textFile方法开始分析

复制代码
   /** * Read a text file from HDFS, a local file system (available on all nodes), or any
    
    * Hadoop-supp

全部评论 (0)

还没有任何评论哟~