word2vec基于大规模语料库的模型初始化过程
发布时间
阅读量:
阅读量
目前word2vec训练仅限于CPU实现,在处理大规模语料时若将全部数据一次性加载至内存,则可能导致内存占用过高。其中一种解决方案是在训练过程中从本地文件系统中读取所需数据,并提供以下本地文本读取函数供调用:
def sentence2words(sentence, stopWords=False, stopWords_set=None):
words = []
for word in sentence.split():
words.append(word)
return words
class MySentences(object):
def __init__(self, list_csv):
self.fns = list_csv
def __iter__(self):
for fn in self.fns:
with open(fn, 'r') as f:
for line in f:
yield sentence2
全部评论 (0)
还没有任何评论哟~
