Hadoop 倒排索引 原理 解析
发布时间
阅读量:
阅读量
倒排索引的概念源自实际应用中对特定属性值进行记录检索的需求,该索引结构中的每一个条目均包含一个属性值以及对应具有该属性值的所有记录的位置信息。由于其构建方式并非通过记录确定属性值,而是依据属性值定位相关记录,因此被称作倒排索引。为了深入理解这一概念,我查阅了相关资料进行学习,以下是我对倒排索引的理解。
假设有两个文件分别为123.txt和456.txt,其内容如下:
123.txt
Hello world
nice to meet you
happy good
Would you like to play basketball with me
Hello hadoop
basketball good
good better best nice
sun moon star sky
Map 阶段开始之前
在 Map 阶段启动之前 所获取到的文件为
1.txt
0 Hello world
13 nice to meet you
31
全部评论 (0)
还没有任何评论哟~
