SECodec:基于结构熵的压缩语音编解码器
发布时间
阅读量:
阅读量
伴随大型语言模型(LLM)技术的迅猛演进,实现语音与LLM的融合亟需构建高效的离散化表征体系。当前主流声学特征离散化方案普遍采用固定设定码本容量及欧氏距离度量准则进行向量量化处理。然而存在双重局限性:其一,在编码器-解码器架构中码本规模作为核心变量显著影响系统效能及后续任务的学习效率;其二,在合理参数区间内传统欧氏距离量化策略易引发音频信号畸变现象。值得注意的是,在数据压缩研究领域中结构性特征与熵驱动机制具有决定性作用价值——这一本质规律在既往研究中被明显忽视。为此我们从信息理论视角切入应对前述挑战:创新性提出基于结构熵(Structural Entropy, SE)框架的SECodec编解码体系架构以构建新型声学表征系统。具体实施路径包含两个层面:首先建立声学信号图谱模型对特征节点实施聚类分析,并通过层级式分离策略优化二维结构熵最小化过程获取对应编码单元;其次针对音频保真度问题设计动态匹配机制——该算法延续二维熵优化原则但引入自适应标记选择策略以实现输入声学节点与最优编码符号间的精准映射关系。进一步开发出依托SECodec架构的结构熵引导型语音语言模型(SESLM),实验验证显示该编解码系统在声音重构质量指标上可媲美EnCodec基准方案;而SESFML在零样本条件下文本到语音生成任务中的表现则超越VALL-E基线模型5.3个百分点以上相关资源包括代码库、示范音频样本、特征图谱可
全部评论 (0)
还没有任何评论哟~
