Advertisement

End-to-End Monitoring Solution for Hadoop

阅读量:

前言

在近期的多篇论述中,我多次提及了一个至关重要的术语——“监控”。为何要强调这一概念?倘若你与我一样,是一名从事大数据工程领域的技术人员,那么你必然需要负责管理大量的集群设备,并且这些集群的规模时常会有所扩展。随着设备数量的增加,系统出现异常的频率和种类也会随之上升。在这种情况下,若仍依赖人工逐一查看单个设备的日志信息,对于1台或2台设备尚可应对,但面对100台甚至1000台设备时,则显然难以胜任。这种低效的方式不仅耗时费力,更可能导致工程师产生极大的心理压力。因此,如何实现对问题的智能化识别与精准定位变得尤为重要。理想的状态是能够获取集群中各类任务运行过程中的各项指标数据,并通过图形化界面进行直观展示,从而仅凭鼠标操作即可快速识别出潜在的问题。这正是我最近正在推进的一项工作内容,并已取得了较为理想的成效。以下是我过去一个月内针对部门所使用的Hadoop集群在监控方面所开展的一些实践尝试,并非高深复杂的架构设计,而是通过最基础的方法实现了最佳的效果。希望这些经验能够为相关领域的同仁提供一定的参考与帮助。

监控两大主题

监控的整体思路已经确定,不过具体需要关注哪些指标,这里有必要进行说明。若想实现有效的监控,首先需要对Hadoop系统架构有一个大致的了解,无需深入掌握所有细节。那么我们是如何开展这项工作的呢?主要分为两个层面:宏观层面和微观层面。从宏观角

全部评论 (0)

还没有任何评论哟~