Advertisement

Spark Streaming简介与应用(包含案例)

阅读量:

目录

  • 1、概述
    • 2、实际应用案例
      • 案例一:通过端口数据采集完成词频统计(Scala实现)
      • 案例二:基于端口数据采集的词频统计(Java实现)
      • 案例三:从指定目录中读取文件数据进行词频统计
      • 案例四:利用Kafka数据源实现词频统计
      • 案例五:开发自定义的数据采集模块

1、简介

Spark Streaming作为Spark核心API的扩展模块,能够达成具备容错能力的高吞吐量实时流数据处理任务。

常见数据来源 :Kafka、Flume、HDFS、TCP socket、文件系统等
处理结果输出至 :HDFS、数据库系统、实时数据分析看板(仪表盘dashboards)

SparkStreaming内置了多种高级API操作符,支持通过底层复杂算法对数据进行高效处理。

在这里插入图片描述

SparkStreaming 能够接收实时输入的数据流,并将其分割为多个批次,随后通过Spark引擎对这些批次进行处理,最终以批量形式生成流式输出结果。实际上,SparkStreaming 的运行机制属

全部评论 (0)

还没有任何评论哟~