flow-fusion system SparkV2/Beam
发布时间
阅读量:
阅读量
当前正处于开发阶段的批流融合系统-SparkV2/Beam,正在持续进行各项功能的完善与优化工作。
SparkV2
回顾
特征分析与提取方法
在Spark Streaming系统的第一代架构中,其核心特征体现为:
- 以批量处理作为基础,通过micro-batch模型将流式计算任务转化为批量处理模式
- 流式计算与批量处理的API具备兼容性 * DStream(一种特殊的RDD)
- RDD
Spark Streaming局限性分析
Spark streaming难以处理的需求
-
事件时间
-
延迟数据
- 流数据所具有的三个特性
- 顺序错乱
- 到达滞后
- 数据量无限
- 流数据所具有的三个特性
-
会话窗口
- 处理过程较为复杂,与批量处理框架存在冲突
Structured Streaming架构解析
- 与Flink相似,实现流式数据向表结构的转换
- 将流处理与表处理的操作整合至DataSet/DataFrameAPI中
- 底层执行引擎仍基于批处理模式 ,持续采用micro-batch的架构
- Continuous query模型目前尚处于研发阶段
处理模型
Unbounded T
全部评论 (0)
还没有任何评论哟~
