基于Word2Vec模型进行多组词语相似性分析
发布时间
阅读量:
阅读量
文章结构概述
- 1. 引言
-
2. 确定对应词汇id
-
3. 算法流程
-
- 3.1 多次执行out无法实现预期效果
- 3.2 调整占位符设置
- 3.3 更改余弦相似度相关变量
- 3.4 启动run程序
-
-
4. 实验数据
-
- 4.1 小规模数据集
- 4.2 实际数据应用
-
-
5. 完整代码实现
-
前言概述与研究背景
此前曾撰写过一篇相关文章,基于预训练词向量的文本相似度计算-word2vec, paddle,内容涉及如何计算某一词语与一组词语之间的相似程度。
本研究重点探讨多个词语组之间相似性对比的实现方式。
所使用的语料如下:
A = ['轿车', '宝石', '旅游', '男孩子',... ]
B = ['汽车', '宝物', '游历', '小伙子', ...]
2. 找到对应词汇id
def getVocab(path="vocab.txt"):
# 读取文件并得到dict
vocab_dict = {} #"unk":0
id = 0
with open(path, "r", enc
全部评论 (0)
还没有任何评论哟~
