WAV2VEC用于语音识别的无监督预训练
发布时间
阅读量:
阅读量
WAV2VEC: 无监督预训练语音识别模型
概要
通过引入大量未标注数据集对wav2vec模型进行预训练,声学模型的性能得到了有效提升。所构建的模型在实际应用中展现出优于Deep Speech 2的表现,在nov92测试集上的词错误率(WER)指标达到了2.43%。
1 简介
在深度学习算法中,预训练技术是一种被广泛采用的策略,其核心目的在于增强模型的整体表现,尤其在当前可用的带标签数据量极为有限的情况下。该策略通常通过利用大量无标签数据或来自其他数据集的有标签数据对模型进行初步训练,使模型能够获取到具有普遍适用性的特征表达。随后,再基于目标数据集对已完成预训练的模型进行微调,在数据资源受限的前提下依然可以实现较为理想的效果。
这一技术在计算机视觉与自然语言处理领域已被广泛应用,在语音处理领域则主要应用于情感识别、说话人识别以及音素区分等场景,但尚未被用于提升语音识别系统的性能。
本研究引入无监督预训练方法以优化ASR系统的识别效果,并选用wav2vec模型作为实现手段。该模型属于卷积神经网络架构,输入为音频信号的原始形式,并通过计算生成一系列关键特征,再基于这些特征完成语音识别任务。在损失函数的设计上采用了对比损失(contrastive loss)。与序列模型相比,卷积模型的优势在于能够更便捷地支持并行计算。
实验结果表明,在WSJ
全部评论 (0)
还没有任何评论哟~
