Python实现文本相似度比较分析
发布时间
阅读量:
阅读量
- 推荐自己的专栏:分享一些Python案例,将所学用出来
一:文本相似度比较概述
通过计算并比较文档的摘要 ,可实现文本的相似度比较。
- 文档摘要的一种基本形式能够通过利用文档中包含的各种连续字符序列(即k-grams)及其在文本中出现频率分布所构成的空间向量来进行简洁表示。
- 假设字符可取数值范围是128种不同的值(对应ASCII码),那么该空间向量的空间维度d将等于128倍于k;而对于采用Unicode编码的情形,则空间维度将变得极其庞大。
- 因此常用的方法是将这些连续字符序列(即k-grams字符串s)通过计算其模运算结果hash(s) % d来进行转换,并这样就能使得最终得到的空间维度正好是d维。
- 在完成上述空间向量构建之后,在比较两个空间向量之间的距离时就能够有效地评估出相应文本段落之间的相似程度。
首先介绍向量类(Vector)及其设计构建过程,并详细阐述文档摘要类(Sketch)的功能及实现细节。进而采用该文档摘要类来评估不同文档之间的相似度。
二:向量(Vector) 类设计和实现
**向量是一种数学概念,在n维空间中可以用一个由n个实数组成的有序序列表示: (x₀, x₁,…,xₙ₋₁)。该序列可被视为一种数学概念,并提供基础的算术运算功能。通过操作符重载功能实现相应的计算操作。
全部评论 (0)
还没有任何评论哟~
