Advertisement

Spark 读取 JDBC 数据库优化

阅读量:

Spark读取JDBC调优,如何调参

  • 一、场景构建
    • 二、参数设置
      • 1.灵活运用分区列

实际问题:在日常工作中,需要从一个存储了三四年历史数据的pg数仓表(该表未设置主键id)中读取数据,并将其同步至阿里云 MC 平台。然而,在使用Spark通过JDBC连接关系型数据库时,系统默认仅启动一个任务进行处理,导致整体执行效率较低。为了解决这一问题,必须对相关参数进行合理配置以提升并行处理能力。在调整这些参数之前,务必深入理解其具体含义,否则可能因配置错误引发数据倾斜等严重问题!

查阅了大量网络上的相关内容,虽然多数资料有所涉及,但并未完全契合需求。以下将对相关内容进行归纳整理!

若您尚处于学习阶段,请认真研读;若您已有丰富经验,欢迎提出宝贵建议!

一、场景构建方法与实现

以100条数据作为示例(实际总数为307983条):

  • 建立数据表
复制代码
    CREATE TABLE IF NOT EXISTS test(
    	good_id STRING ,
    	title STRING ,
    	sellcount BIGINT,
    	salesamount Double
    )COMMENT '测试表'
    PARTITIONED BY (
    	dt	S

全部评论 (0)

还没有任何评论哟~