大数据出行项目二
发布时间
阅读量:
阅读量
9、业务库数据分析
此前我们已借助sparkStreaming程序,从kafka中提取业务库数据,并将所有数据写入Hbase中的四张表(order_info、renter_info、driver_info、opt_alliance_business)中。
对于上述订单表、司机表、用户表及司管方表等,可对存储于Hbase中的相关数据开展统计分析工作。
利用sparkSQL从Hbase读取数据,完成相应的统计分析操作,并通过sparkSQL自定义输出源,将分析结果再次存入Hbase中。
该过程涉及对sparkSQL的Hbase数据源进行自定义配置,以实现从Hbase读取数据的功能;同时,还需对sparkSQL的数据保存机制进行自定义设置,以便将统计结果存储至Hbase之中。
9.1、sparkSQL自定义数据源
1、创建hbase数据源表
为达成从Hbase中提取数据的目标,我们可构建sparkSQL的自定义数据源,并设计相应的测试用例。通过该数据源实现对Hbase内数据的读取操作,随后将查询所得结果存储回Hbase中。在node01节点上,需执行相关命令以创建Hbase表
cd /kkb/install/hbase-1.2.0-cdh5.14.2/
bin/hbase shell
create 'spar
全部评论 (0)
还没有任何评论哟~
