Advertisement

Spark 的数据处理和分析领域中的系统架构

阅读量:

Spark工作流程中基本概念

Application :应用程序

Driver类相当于main()函数,并负责初始化SparkContext对象。该对象用于管理与ClusterManager之间的通信,并在必要时获取资源所需的申请以及处理任务分配并实时监控运行状态。在程序结束后自动释放SparkContext实例以释放资源

执行者:某个Application运行在Worker节点上的一个进程,在接收并处理一系列任务的同时负责管理应用的数据存储位置(内存或磁盘)。每个执行者只有一个对应的主线程对象,在空闲时由主线程将其任务封装为taskRunner实例后抽取空闲线程来执行任务。不同执行者的任务处理能力与其所拥有的核心数量密切相关。

Worker :集群中能够执行Application代码的节点,在Standalone模式下则指通过slave文件进行配置的worker节点,在Spark on Yarn模式下则指的是NodeManager节点。

Task :在Executor进程中执行任务的工作单元,多个Task组成一个Stage

Job :包含多个Task组成的并行计算,是由Action行为触发的

Stage :每个Job会被拆分很多组Task,作为一个TaskSet,其名称为Stage

DAGScheduler

全部评论 (0)

还没有任何评论哟~