(语音数字识别)(free-spoken-digit-dataset)
发布时间
阅读量:
阅读量
刚开始接触深度学习与音频处理相关知识,借助Keras框架及FSDD数据集自行开发了一个用于识别音频数字的模型,目前技术水平尚处于初级阶段,还望多多包涵(TnT)。
数据来源
https://github.com/Jakobovski/free-spoken-digit-dataset,该数据包含数字0 - 9,每个编号对应300条数据,总计包含3000条信息。
数据处理
首先,我对这3000条数据进行随机排序,选取前2700条作为训练集,剩余的300条则用作测试集。
特征提取
1、对音频信息以16K的采样率进行采集
2、将数据调整为均值为0且方差为1的标准形式
3、从音频中提取MFCC特征参数
4、对所获取的每个MFCC特征进行平均处理(也可选择使用最大值,但实验表明均值的处理效果显著优于最大值)
代码:(name可作为后续进行说话人识别及性别判断的依据)
import os
import random
import librosa
import numpy as np
import librosa.display
import matplotlib.pyplot as plt
class GetData:
"""
一共有300
全部评论 (0)
还没有任何评论哟~
