大数据-Hadoop-HA: HA确保连续运行, HDFS和YARN的HA需注意资源消耗, 最有效的策略是消除单点故障
发布时间
阅读量:
阅读量
第1章 Hadoop HA高可用
1.HA概念与研究背景
(1)HA(High Availability)即高可用性,其核心特征在于能够实现7×24小时不间断服务。
(2)要确保高可用性的关键举措在于规避单点失效风险。严格意义上,HA应被划分为不同组件的高可用机制,具体包括HDFS的高可用性和YARN的高可用性。
(3)NameNode在以下两个方面对HDFS集群运行产生显著影响:
- 当NameNode所在主机发生异常情况,例如系统崩溃时,整个集群将无法正常运作,直至管理员进行重启操作。
- 若需要对NameNode所在的主机进行软件或硬件升级,则在此期间集群也将处于不可用状态。
为应对上述问题,HDFS的高可用功能通过设置多个NameNode(分别处于活动与待命状态)来实现对NameNode的热备份。一旦出现故障,比如主机崩溃或需要进行维护升级时,即可迅速将NameNode切换至另一台主机上运行。
1.2 HDFS-HA核心问题

1)如何确保三台namenode之间的数据一致性
(1)Fsimage:通过其中一台nn生成数
全部评论 (0)
还没有任何评论哟~
