Advertisement

Hadoop管理类级全球变量

阅读量:

此前曾有过在Hadoop平台编写程序时引入全局变量的设想,但最终并未成功实施,后来通过查阅资料得知Hadoop本身并不支持全局变量的使用。然而,在实际编程过程中,有时又会遇到需要此类功能的情况,例如在编写k-means算法时,若能通过一个全局变量来存储聚类中心点将会非常方便。实际上,在Hadoop中确实存在实现类似功能的方法,例如可以在mapper阶段的setup函数中加载一个小型文件,并从中读取所需的全局变量值。

那么具体该如何操作呢?建议首先明确一个需要解决的问题,再基于该问题展开思路进行处理。以下将具体说明我所要实现的问题:当前输入数据如下:

复制代码
 0.0      0.2     0.4

    
 0.3	0.2	0.4
    
 0.4	0.2	0.4
    
 0.5	0.2	0.4
    
 5.0	5.2	5.4
    
 6.0	5.2	6.4
    
 4.0	5.2	4.4
    
 10.3	10.4	10.5
    
 10.3	10.4	10.5
    
 10.3	10.4	10.5
    
    
    
    

此外,还存在一个小型数据文件(中心点),具体内容如下:

复制代码
 0        0       0

    
 5	5	5
    
 10	10	10
    
    
    

全部评论 (0)

还没有任何评论哟~