基于混响时间感知的深度学习语音去混响方法
2021-11-20王小军马建芬张朝霞
计算机工程与设计 2021年11期
王小军,马建芬+,张朝霞
(1.太原理工大学 信息与计算机学院,山西 晋中 030600;2.太原理工大学 物理与光电工程学院,山西 晋中 030600)
0 引 言
目前已经提出了许多去混响技术[1-5]。一种直接的方法是估计房间脉冲响应(RIR)的反滤波器[6]。然而,这种方法通常需要一个最小相位假设,而在实践中几乎很难满足这一假设[6]。另外一些研究试图通过同态变换来分离语音和混响[7,8]。然而当以人的听觉系统为目标时,它们的去混响效果并不好。
近年来,深度神经网络(DNN)[9,10]得益于其强大的回归能力,也被利用在语音增强[11]、语音分离[12]中。根据训练目标的不同,监督式语音分离方法可以分为基于掩蔽的方法和基于幅度谱估计的方法。其中基于幅度谱估计[13]的方法直接从混响语音中估计出纯净语音的幅度谱结合原始的相位信息来恢复语音,而基于掩蔽的方法[14]通过计算每个T-F单元内目标语音与混响语音的功率之比来估计纯净语音的幅度谱。而单一使用某种方法可能会使最终结果中存在一些“灰色区域”[15],影响最终去混响的效果。
本文将基于掩蔽和基于幅度谱估计的方法整合为一个多目标DNN。并且进一步研究在特征提取阶段不同RT60下设置不同的帧移系数(S)和语音上下文窗系数(W)对去混响语音质量的影响。研究表明一方面在强混响条件下,当S取值较小时,即使以增加计算复杂度为代价,也无法获得良好的去混响效果。另一方面,在特征提取时加大W的值往往会降低RT60下去混响语音的质量。……
登录APP查看全文
