语音信号
发布时间
阅读量:
阅读量
语音信号的采集
常见的语音来源主要由三种组成:公开获取的通用训练数据、专门采集的个性化语音样本以及通过TTS技术生成的人工语音数据。
分公司会收集用户的指令数据,并通过该过程构建通用训练数据库。随后系统会筛选高频样本集合,并分别建立方言及双语对话库以及跨语言交互模块。同时系统还会划分特定场景数据库(如导航指令处理、语音交互功能等),重点解决多场景下的冲突问题。
当进行录音与采样语音数据时,在行业内普遍采用以下几个关键指标;这些关键指标都与语音识别的原理及架构紧密相关。
采样率
同时也被称为采样频率;它表示每秒能捕捉的声音样本数量;当采样率越高时;数据更为精准;常见的标准有8千赫兹(即8千)、16千赫兹、44点1千赫兹以及48千赫兹。
8k是电话所用的采样率。人说话的声音频率,基本在这个采样率之内。
48k采样率是CD,DVD所采用的。超过这个频率人耳是分辨不出来的了。
手机平台中,采样率大都数采样16k。
采样位数
每个采样数据所代表的数量决定了其精度水平。其精度受所选采样比特数量大小的影响。通常情况下会采用8比特(bit),相当于一个字节单位。此外还有16比特或32比特的选择。
手机平台中一般为16位采样位数。
采样编码
腾讯只支持GBK?
全部评论 (0)
还没有任何评论哟~
