Advertisement

spark进阶(八): spark streaming的用法 [下] structured streaming的使用

阅读量:

Spark 2.0版本引入了一个新的流处理框架——Structured Streaming(结构化流),该框架集成了可伸缩性和容错设计,并集成于Spark SQL引擎之上。通过StructuredStreaming组件可以在静态数据集(Dataset/DataFrame)上实现类似批量计算的操作,并支持面对接而来的数据持续注入并实时更新最终结果的状态。

从简而言之来说的话,则可以看出:DSteam是一种基于RDD模型构建起来的操作系统,而Structured Streaming则建立在DataFrame的基础上

默认情况下,默认使用微批量引擎对数据流进行分批次处理以实现端到端延迟低至100毫秒的性能表现。从Spark 2.3版本开始引入了一种新的低延迟处理模式称为流水线处理模式它将端到端延迟进一步降至1毫秒。开发者无需关心是基于流的数据计算还是批处理式的作业调度只需采用相同的方式编写计算逻辑即可 Structured Streaming底层自动实现了快速响应可扩展性和容错能力。

一、简单使用

添加依赖:

复制代码
    <dependency>
      <groupId>org.apache.spark</groupId>
      <artifactId>spark-sql-kafka-0-10_2.12</artifactId>
      <vers

全部评论 (0)

还没有任何评论哟~