动态特征联合新掩模优化神经网络语音增强
2021-07-01梅淑琳贾海蓉王晓刚武奕峰
西安电子科技大学学报 2021年3期
梅淑琳,贾海蓉,王晓刚,武奕峰
(1.太原理工大学 信息与计算机学院,山西 太原 030024;2.中国联通 山西省分公司网络优化中心,山西 太原 030000)
语音增强是从噪声背景中提取有用信号,降低干扰并减少失真的技术,可以应用在人工智能、助听器、语音识别等领域。目前,语音增强的方法可分为无监督和有监督两类。无监督语音增强大多基于平稳噪声、语音噪声不相关等不合理假设,导致抑制非平稳噪声能力弱,产生语音失真现象;具有代表性的算法有谱减法、维纳滤波等[1]。有监督语音增强通过学习信号的统计特性来抑制噪声,在低信噪比环境和非平稳噪声上有着明显的优势,可分为基于浅层和深层模型两种。浅层模型包括隐马尔科夫、浅层神经网络等。该模型由于层数及每层节点数目都很少,且用于训练的数据也很小,限制了学习能力,性能不能有效提升。深层模型能够深入学习语音间非线性关系[2],极大地提高了其在未知噪声环境中的泛化性能。大致可以分为3类:基于特征映射的语音增强,输入和输出信号的声学特征;基于时频掩蔽的语音增强,输入声学特征,输出时频掩蔽;基于信号近似的语音增强,是前两种方法的融合,训练模型预测掩蔽值,最终优化目标是估计语音与纯净语音的均方误差,使网络收敛到一个最优点。因此处理非平稳噪声性能较好,成为研究热点[3-6]。
近年来,人们提出了几种有效的学习算法,有效提升了网络的性能。……
登录APP查看全文
