声纹识别的核心技术
发布时间
阅读量:
阅读量
从信号到特征-短时分析
传统特征分析的不足
在训练过程中,研究对象通常需要被转化为具有固定维度的向量形式,这种向量即被定义为特征。
以往的做法是将整段音频信号(无论长短)作为全局特征进行处理。然而,对于语音信号而言,这种全局特征存在一定的不稳定性,从而影响了研究的实际效果。值得注意的是,语音信号具备短时平稳性的特性,因此通过提取其局部特征并进行训练,能够取得更为理想的结果。
分帧
此处的分帧操作与视频处理中的分帧理念具有相似之处。针对语音信号,同样可以将采样数据沿着时间轴划分为多个较短的时间段,这些时间段被定义为帧。在进行分帧处理时,需重点关注两个关键参数:单个帧所覆盖的时间长度,即帧长;以及相邻两帧之间的时间间隔,即帧移。
通常情况下,人们会设定25ms作为帧长,10ms作为帧移。当帧移数值小于帧长时,相邻的两帧会出现重叠区域;若两者数值相等,则不会出现重叠;而当帧移大于帧长时,则可能导致音频信号的部分内容无法被完整覆盖。
以采样率为16khz的音频为例,每帧提取40维的特征信息,并设定25ms为帧长、10ms为帧移。对于持续时间为1秒的音频文件而言,最终可提取出100*40=4000个特征参数。
窗函数
在完成对采样信号的分帧操作后,即可针对每一帧数据实施特征提取工作。然而
全部评论 (0)
还没有任何评论哟~
