Advertisement

Hadoop 倒排索引 原理 解析

阅读量:

倒排索引的概念源自实际应用中对特定属性值进行记录检索的需求,该索引结构中的每一个条目均包含一个属性值以及对应具有该属性值的所有记录的位置信息。由于其构建方式并非通过记录确定属性值,而是依据属性值定位相关记录,因此被称作倒排索引。为了深入理解这一概念,我查阅了相关资料进行学习,以下是我对倒排索引的理解。

假设有两个文件分别为123.txt和456.txt,其内容如下:
123.txt

复制代码
    Hello world 
    nice to meet you
    happy good
    Would you like to play basketball with me
    
    
      
      
      
      
    
复制代码
    Hello hadoop
    basketball good
    good better best nice
    sun moon star sky
    
    
      
      
      
      
    

Map 阶段开始之前
在 Map 阶段启动之前 所获取到的文件为
1.txt

复制代码
     0		Hello world
    13		nice to meet you
    31		

全部评论 (0)

还没有任何评论哟~