培训使用OpenNMT进行对话模型开发
发布时间
阅读量:
阅读量
- 数据处理:
th preprocess.lua -train_src data/src-train.txt -train_tgt data/tgt-train.txt -valid_src data/src-val.txt -valid_tgt data/tgt-val.txt -save_data data/demo
训练数据中,src-train.txt用于存储输入语句,而tgt-train.txt则保存对应的回答内容,二者之间存在一一对应的关系;验证数据包括src-val.txt和tgt-val.txt。输入数据中的每个字均以空格分隔,在读取时需按照空格作为分隔符逐字提取。
在处理过程中,首先对src-train.txt进行处理,生成字典文件src.dict;随后对tgt-train.txt进行处理,生成对应的字典tgt.dict。接着,利用这两个字典将相应的语料内容转换为数字索引形式,并将最终处理完成的数据及字典信息一并保存至demo-train.t7文件中。
此外,输入内容还可以附加其他特征信息,例如词性标注等特征内容。
2)模型训练:
th train.lua -data data/demo-train.t7 -save_model model-demo -gpuid 1
对预处理
全部评论 (0)
还没有任何评论哟~
