Python基于Word2Vec计算词语相似度(gensim实现)
发布时间
阅读量:
阅读量
借助 gensim 工具对中文语料进行词向量训练,进而评估词语间的相似程度。
输入数据为文本格式的语料库文件。
最终生成的结果为余弦相似度数值。
实现代码:
# -*- coding: utf-8 -*-
import logging
from gensim import models
from gensim.models import word2vec
def main():
logging.basicConfig(format='%(asctime)s : %(levelname)s : %(message)s', level=logging.INFO)
sentences = word2vec.LineSentence("output.txt")
model = word2vec.Word2Vec(sentences, size=250)
# 保存模型,供以后使用
model.save("word2vec.model")
# 模型读取
# model = word2ve
全部评论 (0)
还没有任何评论哟~
