Advertisement

word2vec基于大规模语料库的模型初始化过程

阅读量:

目前word2vec训练仅限于CPU实现,在处理大规模语料时若将全部数据一次性加载至内存,则可能导致内存占用过高。其中一种解决方案是在训练过程中从本地文件系统中读取所需数据,并提供以下本地文本读取函数供调用:

复制代码
 def sentence2words(sentence, stopWords=False, stopWords_set=None):

    
  
    
     words = []  
    
     for word in sentence.split():
    
       words.append(word)
    
     return words
复制代码
 class MySentences(object):

    
     def __init__(self, list_csv):
    
    
    
     self.fns = list_csv
    
  
    
     def __iter__(self):
    
     for fn in self.fns:
    
         with open(fn, 'r') as f:
    
             for line in f:
    
                 yield sentence2

全部评论 (0)

还没有任何评论哟~