Advertisement

HDFS源码分析(四)-----节点解离机制

阅读量:

前言

根据集群规模的不同,在Hadoop生态系统中存在大小不一的集群配置。其中大型集群如百度等企业拥有数千台甚至上万台节点资源;反之,在小型集群环境中也常见几十台机器组成的配置方案。无论是在超大规模集群环境还是小型集群环境下都会面临节点故障的问题;尤其是超大规模集群环境中几乎每天都会有节点出现故障的情况发生;因此如何实现稳定可靠的故障处理机制就显得尤为重要了。在这里我们可以分享一种基于Hadoop设计的基本故障处理思路即通过Decommission操作来进行节点下线操作;当出现故障节点时一般情况下这些节点已经处于dead状态或因异常情况导致无法正常运行;如果不及时采取措施可能会严重影响整个系统的运行效率;因此建议采用Decommission策略来快速解决这些问题以保障系统的稳定运行

Hadoop节点Decommision操作

在分析相关源码之前

相关涉及类

因为介绍decommission操作耗时较多的原因是因为其操作顺序与实际代码运行流程基本上一致,并且存在较强的关联性,在后续的具体分析中将逐步体现这一特点。为了方便起见,请您参考以下两个相关的类

DecommissionManager--属于退让操作管理模块,并且其中包含有退让操作状态监控功能

该系统属于一类较为复杂的操作体系,在其核心架构下包含了多个模块协同作业的工作流程。其中涉及到了之前介绍过

全部评论 (0)

还没有任何评论哟~