Advertisement

(语音数字识别)(free-spoken-digit-dataset)

阅读量:

刚开始接触深度学习与音频处理相关知识,借助Keras框架及FSDD数据集自行开发了一个用于识别音频数字的模型,目前技术水平尚处于初级阶段,还望多多包涵(TnT)。

数据来源

https://github.com/Jakobovski/free-spoken-digit-dataset,该数据包含数字0 - 9,每个编号对应300条数据,总计包含3000条信息。

数据处理

首先,我对这3000条数据进行随机排序,选取前2700条作为训练集,剩余的300条则用作测试集。

特征提取

1、对音频信息以16K的采样率进行采集
2、将数据调整为均值为0且方差为1的标准形式
3、从音频中提取MFCC特征参数
4、对所获取的每个MFCC特征进行平均处理(也可选择使用最大值,但实验表明均值的处理效果显著优于最大值)

代码:(name可作为后续进行说话人识别及性别判断的依据)

复制代码
    import os
    import random
    import librosa
    import numpy as np
    import librosa.display
    import matplotlib.pyplot as plt
    
    class GetData:
    
    """
    一共有300

全部评论 (0)

还没有任何评论哟~