Spark Streaming中的维度管理器开发
发布时间
阅读量:
阅读量
文章目录
-
简介
-
设计
-
- 常规方法
- 存在的问题
- 通用的方法
-
实现
-
- 获取最新分区
- 数据加载
-
小结
简介
根据分类标准, 数据可分为两类: 一种是维度属性(即属性维度), 另一种是事实属性(即事务记录)。星型架构是典型的二维设计模式, 在实际应用中被广泛应用, 在构建元模型时必须考虑引入元维信息, 以便实现多维分析的需求, 并确保各元模型之间有良好的对应关系
具体而言,在流式实时性任务中若继续采用逐个batch方式进行维度信息获取的做法,则不仅会带来大量冗余的数据读取操作(即所谓的"浪费"),而且当维表存储规模较大时还会导致显著增加的数据处理延迟问题。”
支持在流式实时任务中对维度数据进行缓存获取作为一项必要功能。建议从框架层面设计一个直观易用的数据接口方案,并在此方案下为用户提供最新的有效维度数据。
设计
维度空间作为一个整体的配置信息。其特点在于数据规模较小,并且具有缓慢变化的趋势。同时由于更新频率较低,在Executor内存中进行缓存。基于这一特性,在Executor内存中持续进行更新。
常规方法
在Spark Streaming框架中,默认的转换操作可以通过特定的方式进行配置。通过官方文档可得,默认情况下,在每次批次处理时,默认会在计算阶段
全部评论 (0)
还没有任何评论哟~
