Advertisement

MapReduce作为分布式计算框架的一部分

阅读量:

文章目录

  • 基于分布式架构的并行计算框架MapReduce
  • 探讨Hadoop在性能上的优势
  • 理解MapReduce核心思想
  • 基于MapReduce的并行计算实现
  • Hadoop MapReduce设计思路解析
  • 基于MapReduce的数据类型实践

MapReduce编程规范及示例编写

Map阶段包含以下两个步骤

Shuffle阶段需完成以下四项任务(其中后两项无需关注)

Shuffle阶段中的Partition分区算法需完成核心逻辑

Reduce阶段同样包含两个关键步骤

Mapper以及Reducer抽象类均需进行功能定义

  1. Mapper抽象类的基本功能定义

  2. Reducer抽象类的基本功能定义

    • MapReduce程序运行模式
      • 本地模式运行代码设置
      • 集群运行模式

Hadoop组成

  • Hadoop HDFS:该分布式文件系统以其高度可靠性及大规模吞吐能力著称,在海量数据存储方面表现卓越。
  • Hadoop MapReduce:基于分布式架构的大规模离线并行计算平台为大数据处理提供了强大的技术支持。
  • Hadoop Yarn:作为依赖于HDFS的应用层框架,在作业调度与集群资源管理方面发挥着重要作用。

![在这里插入图片描述](https://ad.itadn.com/c/we

全部评论 (0)

还没有任何评论哟~