Spark JDBC RDD深入解析
发布时间
阅读量:
阅读量
参数解释
在运用JDBC RDD的过程中,需同时提供共计7个参数
val data = new JdbcRDD(
sc,
getConnection,
"select * from table where id >= ? and id <= ?",
1,
10,
2,
flatValue
)
sc: sparkcontext
getConnection: 用于建立连接的函数
"select * from table where id >= ? and id <= ?": 一条SQL查询语句
1: 需要获取数据的最小id值对应的行
10: 需要获取数据的最大id值对应的行号
2: 数据处理时所采用的分区数量
flatValue: 一种将数据库查询结果转换为特定数据类型的方法
关于jdbc rdd 的分区
override def getPartitions: Array[Partition] = {
// bounds are inclusive, hence
全部评论 (0)
还没有任何评论哟~
