Apache Flink
发布时间
阅读量:
阅读量
Apache Flink论文简读
Apache Flink™:统一引擎下的流处理与批处理能力
相较于Spark侧重于批处理任务,Flink则专注于数据流的实时处理。其输入数据被视为一条无限延续的数据流,通过将特定函数应用于该数据流,并最终生成输出结果。Flink的核心机制基于流式处理架构,具备更低的延迟特性。然而,在某些应用场景下,批处理方式可能更为高效,因此Flink在上层架构中构建了基于流式处理的批处理能力。这一功能通过记录流式处理的起始位置,并在运行过程中维护状态信息,从而实现窗口级别的批处理操作。
批处理与流式处理的主要区别与共性
- 在批处理视角中,数据被视作一个完整的数据集,可理解为一组无序排列的数据记录集合。随后将相应的算法应用至该数据集之上。Spark采用内存中的RDD结构,并将其划分为多个小规模的批次单元,在不同计算节点上进行调度执行。Spark的批处理流程可以看作是一个有向无环图结构,在多轮迭代过程中不断调度作业任务,因此会带来一定的延迟现象。
- 流式处理所面对的是具有无限输入的数据记录序列,与批处理不同之处在于其输入具有有序性,并且包含时间戳信息。Flink在这样的数据流基础上应用算法进行实时计算,具备较低的响应延迟;当存在对批量数据进行加工的需求时,则可通过设定流式计算的起始点,并持续更新和保存运行状态来实现类似批处理的效果
全部评论 (0)
还没有任何评论哟~
