Spark Shuffle机制分析
发布时间
阅读量:
阅读量
文章目录
- Shuffle概述及其演进
-
Shuffle机制的具体实现
-
ShuffleManager接口的功能概述
- ShuffleManager的具体创建过程
- 基于排序机制的ShuffleManager具体实现了哪些功能?
- registerShuffle的具体实现细节
- getWriter的具体功能描述
- getReader的功能说明
- registerShuffle的具体实现细节
-
Shuffle Writer过程解析
-
-
数据聚合与排序
-
- 聚合排序
- 溢写磁盘
-
数据合并与持久化
-
生成索引文件
-
-
Shuffle Reader流程解析如下:
-
确定map任务输出的具体位置坐标。
-
收集blocks相关数据。
-
将blocks划分为本地块和远程块。
-
识别并获取远程块位置信息。
-
识别并收集本地块位置信息。
- reduce端聚合数据
- reduce端排序数据
Shuffle简介与其发展
Shuffle(亦称洗牌),即"洗牌"操作,在基于map-reduce的大数据计算框架中占据核心地位的一个关键阶段。该阶段的主要职责是负责整合并连接map任务产生的输出数据与reduce任务所需的输入数据。在实际应用中,默认情
全部评论 (0)
还没有任何评论哟~
