Advertisement

flow-fusion system SparkV2/Beam

阅读量:

当前正处于开发阶段的批流融合系统-SparkV2/Beam,正在持续进行各项功能的完善与优化工作。

SparkV2

回顾

特征分析与提取方法

在Spark Streaming系统的第一代架构中,其核心特征体现为:

  • 以批量处理作为基础,通过micro-batch模型将流式计算任务转化为批量处理模式
  • 流式计算与批量处理的API具备兼容性 * DStream(一种特殊的RDD)
    • RDD

Spark Streaming局限性分析

Spark streaming难以处理的需求

  • 事件时间

  • 延迟数据

    • 流数据所具有的三个特性
      • 顺序错乱
      • 到达滞后
      • 数据量无限
  • 会话窗口

    • 处理过程较为复杂,与批量处理框架存在冲突

Structured Streaming架构解析

  • 与Flink相似,实现流式数据向表结构的转换
    • 将流处理与表处理的操作整合至DataSet/DataFrameAPI中
    • 底层执行引擎仍基于批处理模式 ,持续采用micro-batch的架构
      • Continuous query模型目前尚处于研发阶段

处理模型

Unbounded T

全部评论 (0)

还没有任何评论哟~