Advertisement

以生成中文文本数据的词向量表示为目标

阅读量:

准备需要训练的原始语料

本研究中,所选用的原始语料来源为docx格式的文档:

如图所示,上述资料即为本研究所采用的语料库。

将语料转换为txt文件格式

在实现过程中采用了docx这一软件包,建议事先通过命令行执行pip install docx进行安装操作:

具体实现代码如下:

复制代码
 import os

    
 import docx
    
  
    
  
    
 def docx_to_txt():
    
     # 打开文件
    
     files = os.listdir('./corpus')    # 此处为你存放语料的路径
    
     with open('corpus.txt', 'w+', encoding='utf-8') as f:
    
     for file_name in files:
    
         if file_name.endswith('docx'):
    
             print(file_name)
    
             f

全部评论 (0)

还没有任何评论哟~