利用向量余弦方法进行文件相似性计算
发布时间
阅读量:
阅读量
注意
-
请在
unix like系统环境下执行以下程序-
请完成
python及python-docx的安装配置 -
建议在操作前仔细查阅
Readme文档内容 -
若程序运行过程中出现异常,可尝试调整宏定义设置
-
使用侧写方式存储数据时,若目录中文件数量过多或单个文件体积过大,可能会引发问题
-
如需切换
n-grams与n-word模式,请先执行make clean命令
-
源码
Github He11oLiu/TextSimilarity
准备工作
依据文献[1]所述,文本相似性评估的常用途径主要包括以下两类:
- 余弦定理
- Jaccard系数
余弦定律
根据参考资料[3]
- 在文本1中所包含的字符为:Z_{1}C_{1},Z_{1}C_{2}…Z_{1}C_{n}
- 上述字符在文本中的出现频次分别为:Z_{1}n_{1},Z_{1}n_{2}…Z_{1}n_{n}
- 文本2中所包含的字符为:Z_{2}C_{1},Z_{2}C_{2}…Z_{2}C_{m}
- 上述字符在文本中的出现频次分别为:$Z_{2}n_{1},Z_{2}n_
全部评论 (0)
还没有任何评论哟~
