Advertisement

语音与影像结合的自监督学习模型及其早期版本(李宏毅 2022)

阅读量:

二零二二年的语音影像上的创新自督导式学习模型在哔哩哔哩这一平台上进行了展示

self-supervised learning for speech and image

如果没有采用自监督技术的话,在没有使用任何预处理的情况下直接进行端到端模型的训练,则需要投入大量的标注音频信号(labeled)。

然而如今推出了语音版BERT后,许多人开始尝试仅用10分钟的时间训练语音识别模型。

不需要对语音版本的BERT进行详细的调整;通常情况下会锁定其参数;通过仅对下游模型进行微调就能获得较好的效果。

ASR语音辨识、 keyword spotting 唤醒词、

语义意义解析、直接从声音信号的内容解析语义,并提供如语音翻译这样的功能:听中文输入并输出英文文字。

![](https://ad.itadn.com/c/weblog/blog-img/images/2025-05-31/63NsCMGd

全部评论 (0)

还没有任何评论哟~