基于HDFS多racks分布的设计实现了高效的block placement policy
发布时间
阅读量:
阅读量
文章结构概述
- 引言
-
HDFS多rack分布的block放置策略
-
- 多rack分布策略的实现方法
-
从旧block放置策略向新block放置策略的过渡过程
-
前言
HDFS系统通过设置三个数据副本的方式,以确保数据的高可用性。同时,HDFS对于这三个副本的部署位置也有专门的规划:其中两个副本被安排在同一个rack(但位于不同的节点),第三个副本则被放置在另一个rack上。采用这种部署方式后,系统能够有效应对单个节点故障甚至整个rack机器宕机的情况。然而,这里所提到的“rack”概念是由集群管理员为HDFS定义的一种逻辑划分,并非严格的物理实体。它既可以代表一个实际的物理rack,也可以表示多个rack组成的集合。这些不同形式的“rack”具有的共同特征是彼此之间可以实现隔离。理论上讲,HDFS当前默认的block放置策略可以容忍一个rack发生故障的情况,但在实际的大规模集群运行中,默认策略却难以完全满足数据高可用性的需求。例如,在最近的一次生产环境中,用户频繁遇到由于三个数据副本同时不可用而导致的数据块缺失问题。经过分析发现,这是因为在进行按rack滚动升级时,每次都会出现长达一小时的rack停机时间,在此期间若其他rack上的机器偶发宕机,则可能引发零星的数据块丢失现象。问题的根本原因在于当一个ra
全部评论 (0)
还没有任何评论哟~
