信息检索 Java 简易搜索引擎原理及实现 四基于布尔模型和向量模型计算权重
发布时间
阅读量:
阅读量
上一篇文章 :【信息检索】Java简易搜索引擎原理及实现(三)B+树索引和轮排索引结构,我们基于倒排索引结构,引入了B+树索引与轮排索引技术,从而实现对带有通配符的模糊查询的支持。
本文重点在于理解并验证布尔模型与向量模型在信息检索领域中的基本应用方式,通过计算若干关键参数,为搜索引擎提供依据,以对各类查询结果进行权值计算和排序处理。
首先对以下概念进行说明:
1. df(document frequency):表示在整体文档集合中包含特定 term 的文档数量
2. tf(term frequency):用于描述每个 term 在单个文档中出现的频率数值
3. wf(weighting term frequency):依据 tf 的数值对 term 进行加权处理,得出相应的权值
关于 wf 的计算公式如下:

4. tf × idf:通过结合df与tf的数值,该参数实质上用于确定某一term在特定文档中的权重值
其中,idf :inverse document frequency

还没有任何评论哟~
