提出一种全量去重算法用于处理大规模题库
发布时间
阅读量:
阅读量
背景
最近工作中遇到了一个问题:如何实现大规模题库的降重?公司在长期积累后拥有上亿道题目的数据库。然而由于来源不一而导致数据库中有大量重复问题,在检索过程中虽然增加了计算负担但并未提升准确性。
面对海量题目时,搜索引擎往往采用智能过滤机制,仅识别并处理有限数量的查询项,这种做法在短期内似乎提高了搜索效率,但实际上却可能导致一些本应被搜索到的相关内容被遗漏,甚至可能使部分正确的查询结果无法获得理想展示,最终反而降低了整体搜索质量。因此,对于一个搜索引擎系统而言,初期增加数据规模能够显著提升搜索效果,但在数据规模达到一定水平后,必须面对因处理能力限制而导致的质量下降这一挑战。优化去重机制成为提升搜索质量的关键一环
一些尝试方案
比较MD5值
为每一题计算其MD5值作为标识符,在新增题目时只需检查题库中是否存在具有相同MD5值的条目即可。
这种方案仅限于两个相同的题目情况下适用,并不适用于现实中的大多数情况。
“A比B大10"与"B比A小10”
“小红买10本书”与“小明买10本书”
“今天空气温度为10度”与“今天的空气温度为10度”
这些应该是重复题,但是MD5值不同,没法去重。
利用最长公共子序列和最小编辑距离算法
基于最长公共子序列算法与最小编辑距离算法的结合,我们可以衡量两道题目之间的相似程度.当两道题的相似程度超过某
全部评论 (0)
还没有任何评论哟~
