multi-language, voice and emotion control cosyvoice_pytorch model
发布时间
阅读量:
阅读量
CosyVoice
CosyVoice多语言、音色和情感控制模型
论文
CosyVoice: 一种基于监督语义令牌的多语言零样本语音合成系统具备扩展性
模型结构
CosyVoice 由四个主要组件构成:文本编码器、语音标记器、大型语言模型以及条件流匹配模型组成。该系统将从文本到语音的转码过程视为一种自回归序列生成任务,并借助条件流匹配模型将语音令牌转化为对应的Mel频谱图表示,在此基础之上运用HiFiGAN声码器生成高质量音频信号。

算法原理
CosyVoice 整合了一个自-注意力基 (transformer)语言模型 (LM),用于将输入 文本转换为声素序列 (tokens)。该系统中的一个关键组件是一个基于 常微分方程组 的 扩散模型 ,它通过时间对齐 重构Mel谱。(ODE-based)扩散 模型在这里被具体化为常微分方程组的形式。接着 使用HiFTNet编码器 从重构Mel谱生成音频波形。此外,在一些应用场景中 辅助模式 是可选的 ,例如跨语言复制与语音识别者的微调推断。
全部评论 (0)
还没有任何评论哟~
