信息检索Java简易搜索引擎原理与实现(五)计算查询与文档相似度、搜索界面开发及服务器快速搭建
发布时间
阅读量:
阅读量
在前一篇文章:【信息检索】Java简易搜索引擎原理及实现(四)利用布尔模型和向量模型计算权值中,我们已完成了最终数据展示所需使用的多数数据的计算工作。本文将进行最后一步处理:对查询词实施预处理操作,并计算查询词与相关文档之间的相似程度,依据相似度从高至低对文档进行排序。同时,还将完成搜索界面的开发以及服务器的快速搭建任务。
1.计算查询与文档相似度
(1)查询词预处理
在第三篇论文中,我们设计了一种结合轮排与B+树的索引架构,当前的查询操作正是基于这一结构进行的,因此首要任务是获取已构建完成的B+树。
在第二篇论文中,我们已经完成了对AND、OR以及ANDNOT三种逻辑运算符的处理,并且能够通过由单一词汇构成的查询链检索出对应的DocId。然而,在实际应用过程中,用户的输入可能并不完全符合我们的预设条件,例如在某个词语的位置可能会输入多个词组。
以一个具体案例为例,假设用户希望检索【数字图像处理 AND 竞赛
public class Experiment6 {
private static Experiment2 experiment2 = new Experiment2();
private static Experiment3 experiment3 = new Experiment3()
全部评论 (0)
还没有任何评论哟~
