Advertisement

培训使用OpenNMT进行对话模型开发

阅读量:
  1. 数据处理:
复制代码
    th preprocess.lua -train_src data/src-train.txt -train_tgt data/tgt-train.txt -valid_src data/src-val.txt -valid_tgt data/tgt-val.txt -save_data data/demo
    

训练数据中,src-train.txt用于存储输入语句,而tgt-train.txt则保存对应的回答内容,二者之间存在一一对应的关系;验证数据包括src-val.txt和tgt-val.txt。输入数据中的每个字均以空格分隔,在读取时需按照空格作为分隔符逐字提取。

在处理过程中,首先对src-train.txt进行处理,生成字典文件src.dict;随后对tgt-train.txt进行处理,生成对应的字典tgt.dict。接着,利用这两个字典将相应的语料内容转换为数字索引形式,并将最终处理完成的数据及字典信息一并保存至demo-train.t7文件中。

此外,输入内容还可以附加其他特征信息,例如词性标注等特征内容。

2)模型训练:

复制代码
    th train.lua -data data/demo-train.t7 -save_model model-demo  -gpuid 1
    

对预处理

全部评论 (0)

还没有任何评论哟~