Advertisement

基于Word2Vec模型进行多组词语相似性分析

阅读量:

文章结构概述

  • 1. 引言
    • 2. 确定对应词汇id

    • 3. 算法流程

        • 3.1 多次执行out无法实现预期效果
      • 3.2 调整占位符设置
      • 3.3 更改余弦相似度相关变量
      • 3.4 启动run程序
    • 4. 实验数据

        • 4.1 小规模数据集
      • 4.2 实际数据应用
    • 5. 完整代码实现

前言概述与研究背景

此前曾撰写过一篇相关文章,基于预训练词向量的文本相似度计算-word2vec, paddle,内容涉及如何计算某一词语与一组词语之间的相似程度。
本研究重点探讨多个词语组之间相似性对比的实现方式。

所使用的语料如下:

复制代码
    A = ['轿车', '宝石', '旅游', '男孩子',... ]
    B = ['汽车', '宝物', '游历', '小伙子', ...]
    
    
      
      
    

2. 找到对应词汇id

复制代码
    def getVocab(path="vocab.txt"):
    # 读取文件并得到dict
    vocab_dict = {} #"unk":0
    id = 0
    with open(path, "r", enc

全部评论 (0)

还没有任何评论哟~