Advertisement

Spark Streaming中的维度管理器开发

阅读量:

文章目录

  • 简介

  • 设计

    • 常规方法
    • 存在的问题
    • 通用的方法
  • 实现

    • 获取最新分区
    • 数据加载
  • 小结

简介

根据分类标准, 数据可分为两类: 一种是维度属性(即属性维度), 另一种是事实属性(即事务记录)。星型架构是典型的二维设计模式, 在实际应用中被广泛应用, 在构建元模型时必须考虑引入元维信息, 以便实现多维分析的需求, 并确保各元模型之间有良好的对应关系

具体而言,在流式实时性任务中若继续采用逐个batch方式进行维度信息获取的做法,则不仅会带来大量冗余的数据读取操作(即所谓的"浪费"),而且当维表存储规模较大时还会导致显著增加的数据处理延迟问题。”

支持在流式实时任务中对维度数据进行缓存获取作为一项必要功能。建议从框架层面设计一个直观易用的数据接口方案,并在此方案下为用户提供最新的有效维度数据。

设计

维度空间作为一个整体的配置信息。其特点在于数据规模较小,并且具有缓慢变化的趋势。同时由于更新频率较低,在Executor内存中进行缓存。基于这一特性,在Executor内存中持续进行更新。

常规方法

在Spark Streaming框架中,默认的转换操作可以通过特定的方式进行配置。通过官方文档可得,默认情况下,在每次批次处理时,默认会在计算阶段

全部评论 (0)

还没有任何评论哟~