Self training and pre training作为语音识别的补充
发布时间
阅读量:
阅读量
自训练与预训练在语音识别中的互补性
简介
基于自我训练与无监督预训练的两种方法在语音识别系统的优化中具有互补性,但目前尚不明确其是否能够捕捉到详尽的模式特征,以及如何实现两者的高效融合。本研究仅采用时长为10分钟的标注数据集(Libri-light)及5,300小时的未标注数据集(LibriVox)进行模型训练,在Librispeech数据集的clean与other子集上分别达到了3.0%和5.2%的词错误率。而当使用全部标注数据进行训练后,测试结果则提升至1.5%和3.1%。
背景
2.1 无监督预训练模型
所采用的模型为Baevski提出的wav2vec架构
2.2 Self-training 方法
本研究采用Kahn等人(2020;[13])与Synnaeve等人(2020;[2])提出的伪标签方法。首先利用带有标注信息的数据集对一个初始声学模型进行训练,随后借助该模型以及语言模型,为未标注的数据生成对应的标签。最终,将这些伪标签数据与原始标注数据共同用于训练一个全新的声学模型。
部分学者在研究中多次迭代应用伪标签技术以构建新模型,此方式虽有助于提升识别准确率,但本文仅实施了一次伪标签训练过程。此举不仅显著降低了计算资源的消耗,同时也有助于探讨预训练与伪标签两种方法之间是否存在协同效应。
2.3 两
全部评论 (0)
还没有任何评论哟~
