Spark Streaming简介与应用(包含案例)
发布时间
阅读量:
阅读量
目录
- 1、概述
- 2、实际应用案例
- 案例一:通过端口数据采集完成词频统计(Scala实现)
- 案例二:基于端口数据采集的词频统计(Java实现)
- 案例三:从指定目录中读取文件数据进行词频统计
- 案例四:利用Kafka数据源实现词频统计
- 案例五:开发自定义的数据采集模块
- 2、实际应用案例
1、简介
Spark Streaming作为Spark核心API的扩展模块,能够达成具备容错能力的高吞吐量实时流数据处理任务。
常见数据来源 :Kafka、Flume、HDFS、TCP socket、文件系统等
处理结果输出至 :HDFS、数据库系统、实时数据分析看板(仪表盘dashboards)
SparkStreaming内置了多种高级API操作符,支持通过底层复杂算法对数据进行高效处理。

SparkStreaming 能够接收实时输入的数据流,并将其分割为多个批次,随后通过Spark引擎对这些批次进行处理,最终以批量形式生成流式输出结果。实际上,SparkStreaming 的运行机制属
全部评论 (0)
还没有任何评论哟~
