Advertisement

Python基于Word2Vec计算词语相似度(gensim实现)

阅读量:

借助 gensim 工具对中文语料进行词向量训练,进而评估词语间的相似程度。

输入数据为文本格式的语料库文件。

最终生成的结果为余弦相似度数值。

实现代码:

复制代码
 # -*- coding: utf-8 -*-

    
  
    
 import logging
    
  
    
 from gensim import models
    
 from gensim.models import word2vec
    
  
    
  
    
 def main():
    
     logging.basicConfig(format='%(asctime)s : %(levelname)s : %(message)s', level=logging.INFO)
    
     sentences = word2vec.LineSentence("output.txt")
    
     model = word2vec.Word2Vec(sentences, size=250)
    
  
    
     # 保存模型,供以后使用
    
     model.save("word2vec.model")
    
  
    
     # 模型读取
    
     # model = word2ve

全部评论 (0)

还没有任何评论哟~