Advertisement

Spark JDBC RDD深入解析

阅读量:

参数解释

在运用JDBC RDD的过程中,需同时提供共计7个参数

复制代码
    val data = new JdbcRDD(

    
       sc,
    
       getConnection,
    
       "select * from table where id >= ? and id <= ?",
    
       1,
    
       10,
    
       2,
    
       flatValue
    
     )
    
    
    
    

sc: sparkcontext

getConnection: 用于建立连接的函数

"select * from table where id >= ? and id <= ?": 一条SQL查询语句

1: 需要获取数据的最小id值对应的行

10: 需要获取数据的最大id值对应的行号

2: 数据处理时所采用的分区数量

flatValue: 一种将数据库查询结果转换为特定数据类型的方法

关于jdbc rdd 的分区

复制代码
 override def getPartitions: Array[Partition] = {

    
     // bounds are inclusive, hence 

全部评论 (0)

还没有任何评论哟~