一种基于时频域特征融合的语音增强方法
2021-10-15袁文浩时云龙胡少东娄迎曦
计算机工程 2021年10期
关键词:特征
袁文浩,时云龙,胡少东,娄迎曦
(山东理工大学计算机科学与技术学院,山东淄博 255000)
0 概述
近年来,基于深度神经网络的语音增强方法成为语音识别领域的研究热点[1-3],相比传统统计方法明显提高了非平稳噪声条件下的语音增强性能。为提高神经网络的语音增强性能,现有研究工作主要针对训练特征和训练目标的设计以及网络结构的改进展开。根据训练特征和训练目标的设计方法,基于深度神经网络的语音增强方法可分为频域和时域两类。
频域的语音增强一般将含噪语音经过短时傅里叶变换得到的幅度谱或对数功率谱作为训练特征,而训练目标除了纯净语音的幅度谱或对数功率谱,还可以是由幅度谱计算得到的掩蔽特征。文献[4-5]采用全连接神经网络建立一个从含噪语音对数功率谱到纯净语音对数功率谱的映射关系。基于语音在时间维度上的序列性,文献[6-7]分别采用循环神经网络(Recurrent Neural Network,RNN)和长短时记忆(Long Short-Term Memory,LSTM)网络来估计含噪语音的掩蔽特征。当采用多帧的含噪语音幅度谱或对数功率谱作为训练特征时,网络输入将在时间和频率两个维度上都具有相关性。文献[8]采用一个全卷积神经网络(Fully Convolutional Network,FCN)络构来建立含噪语音幅度谱和纯净语音幅度谱之间的映射关系实现语音增强。文献[9]建立了结合卷积层、池化层和全连接层的网络结构进行语音增强。文献[10-11]在网络结构中引入门控机制和残差学习,而文献[12]基于密集连接卷积网络结构来提高网络在时间和频率两个维度上的感受野。……
登录APP查看全文
