Advertisement

大数据出行项目二

阅读量:

9、业务库数据分析

此前我们已借助sparkStreaming程序,从kafka中提取业务库数据,并将所有数据写入Hbase中的四张表(order_info、renter_info、driver_info、opt_alliance_business)中。

对于上述订单表、司机表、用户表及司管方表等,可对存储于Hbase中的相关数据开展统计分析工作。

利用sparkSQL从Hbase读取数据,完成相应的统计分析操作,并通过sparkSQL自定义输出源,将分析结果再次存入Hbase中。

该过程涉及对sparkSQL的Hbase数据源进行自定义配置,以实现从Hbase读取数据的功能;同时,还需对sparkSQL的数据保存机制进行自定义设置,以便将统计结果存储至Hbase之中。

9.1、sparkSQL自定义数据源

1、创建hbase数据源表

为达成从Hbase中提取数据的目标,我们可构建sparkSQL的自定义数据源,并设计相应的测试用例。通过该数据源实现对Hbase内数据的读取操作,随后将查询所得结果存储回Hbase中。在node01节点上,需执行相关命令以创建Hbase表

复制代码
    cd /kkb/install/hbase-1.2.0-cdh5.14.2/
    bin/hbase shell
    create 'spar

全部评论 (0)

还没有任何评论哟~