以生成中文文本数据的词向量表示为目标
发布时间
阅读量:
阅读量
准备需要训练的原始语料
本研究中,所选用的原始语料来源为docx格式的文档:

如图所示,上述资料即为本研究所采用的语料库。
将语料转换为txt文件格式
在实现过程中采用了docx这一软件包,建议事先通过命令行执行pip install docx进行安装操作:
具体实现代码如下:
import os
import docx
def docx_to_txt():
# 打开文件
files = os.listdir('./corpus') # 此处为你存放语料的路径
with open('corpus.txt', 'w+', encoding='utf-8') as f:
for file_name in files:
if file_name.endswith('docx'):
print(file_name)
f
全部评论 (0)
还没有任何评论哟~
