Advertisement

Hadoop集群中JobTracker和TaskTracker启动耗时长的原因探讨

阅读量:

在正式环境下,在发生配置更改时必须重启JobServer和TaskServer节点的过程。通过快速启动机制完成启动流程后,在访问了JobServer 5030端口上的Web界面时发现未能探测到任何一条TaskServer节点;大约10分钟后才全部探测完毕。

另外,如下参数,如无说明,均为Hadoop 1.2.1版本参数。

重现

此问题令我们深感困扰,并曾一度怀疑系Hadoop内部机架探测速度迟钝所致。直至最近一次操作中因运维团队需要将某个TaskTracker机器移至新位置而不得不重新启动该机器,在完成节点上JobTracker及DataNode进程的重启操作后发现JobTracker经过长时间依然无法探测到该节点上的TaskTracker设备,在此情况下NameNode却早已成功探测到了DataNode资源。出现问题后我们尝试了单独启动该TaskTracker进程却发现系统检测到了两个这样的设备最终才恢复到只有一个正常的TaskTracker节点的状态。

分析

为了弄清楚发生了什么事情, 我们审阅了JobTracker和TaskTracker的日志记录. 由于日志文件数量庞大, 这里仅列出关键的日志条目. 另外, 关闭的TaskTracker节点 hostname 为 datanode6.dataplat.com.

首先是JobTracker的

全部评论 (0)

还没有任何评论哟~