Advertisement

大数据-Hadoop-HA: HA确保连续运行, HDFS和YARN的HA需注意资源消耗, 最有效的策略是消除单点故障

阅读量:

第1章 Hadoop HA高可用

1.HA概念与研究背景

(1)HA(High Availability)即高可用性,其核心特征在于能够实现7×24小时不间断服务。

(2)要确保高可用性的关键举措在于规避单点失效风险。严格意义上,HA应被划分为不同组件的高可用机制,具体包括HDFS的高可用性和YARN的高可用性。

(3)NameNode在以下两个方面对HDFS集群运行产生显著影响:

  • 当NameNode所在主机发生异常情况,例如系统崩溃时,整个集群将无法正常运作,直至管理员进行重启操作。
  • 若需要对NameNode所在的主机进行软件或硬件升级,则在此期间集群也将处于不可用状态。

为应对上述问题,HDFS的高可用功能通过设置多个NameNode(分别处于活动与待命状态)来实现对NameNode的热备份。一旦出现故障,比如主机崩溃或需要进行维护升级时,即可迅速将NameNode切换至另一台主机上运行。

1.2 HDFS-HA核心问题

1)如何确保三台namenode之间的数据一致性

(1)Fsimage:通过其中一台nn生成数

全部评论 (0)

还没有任何评论哟~