低信噪比下联合训练生成对抗网络的语音分离*
2021-06-25全海燕
王 涛,全海燕
(昆明理工大学信息工程与自动化学院,云南 昆明 650500)
1 引言
不同于用语音增强去抑制噪声信号来提升目标语音能量,语音分离技术是希望将目标说话人语音从多说话人的混合语音中分离出来。早在20世纪80年代,相关研究人员就对该领域有了深入研究,但这些方法在低信噪比SNR(Signal-to-Noise Ratio)的条件下,分离性能都不太理想。后来随着计算机性能的提升和人工神经网络技术的成熟,研究者们对语音信号的特征研究更加深入,由于低信噪比SNR下目标说话人语音较弱,其特征不明显,因此增加了对语音分离的难度。
神经网络是近年来受各领域欢迎的热门方向。1989年,Tamura团队[1]提出将神经网络运用到混合语音分离中,来得到目标语音在时域上的非线性映射。随后,Xie等人[2]通过提取语音信号的频域特征,再将其送入神经网络来学习目标语音的映射关系。但是,由于计算机性能的限制,早期的神经网络层数较少,结构简单,并且训练数据较少,无法得到更为准确的映射关系。而近几年,在深度学习浪潮的推动下,深度神经网络DNN(Deep Neural Networks)被广泛应用于语音分离中。2006年,Hinton等人[3]提出深度信念网络DBN(Deep Belief Networks),使得神经网络真正意义上有了“深度”。Roman等人[4]率先将DNN用于语音分离,通过特征学习来预测每个时频单元的理想二值掩膜,从本质上提升了分离语音的清晰度。Xu团队[5]通过一个DNN来实现混合语音与目标语音的对数幅度谱映射,并根据相位信息来恢复时域波形。次年,Huang等人[6]提出了基于循环神经网络RNN(Recurrent Neural Networks)的语音分离方法,其分离性能有所提升,但对长时建模的能力有限。……
