Advertisement

利用向量余弦方法进行文件相似性计算

阅读量:

注意

  • 请在unix like系统环境下执行以下程序

    • 请完成pythonpython-docx的安装配置

    • 建议在操作前仔细查阅Readme文档内容

    • 若程序运行过程中出现异常,可尝试调整宏定义设置

    • 使用侧写方式存储数据时,若目录中文件数量过多或单个文件体积过大,可能会引发问题

    • 如需切换n-gramsn-word模式,请先执行make clean命令

源码

Github He11oLiu/TextSimilarity

准备工作

依据文献[1]所述,文本相似性评估的常用途径主要包括以下两类:

  • 余弦定理
  • Jaccard系数

余弦定律

根据参考资料[3]

  • 在文本1中所包含的字符为:Z_{1}C_{1},Z_{1}C_{2}…Z_{1}C_{n}
  • 上述字符在文本中的出现频次分别为:Z_{1}n_{1},Z_{1}n_{2}…Z_{1}n_{n}
  • 文本2中所包含的字符为:Z_{2}C_{1},Z_{2}C_{2}…Z_{2}C_{m}
  • 上述字符在文本中的出现频次分别为:$Z_{2}n_{1},Z_{2}n_

全部评论 (0)

还没有任何评论哟~