联合稀疏非负矩阵分解和神经网络的语音增强
2018-11-13时文华倪永婧张雄伟
计算机研究与发展 2018年11期
关键词:方法
时文华 倪永婧 张雄伟 邹 霞 孙 蒙 闵 刚
1(陆军工程大学指挥信息系统学院 南京 210007) 2(空军航空大学飞行训练基地 辽宁阜新 123100) 3(燕山大学信息科学与工程学院 河北秦皇岛 066004) 4(河北科技大学信息科学与工程学院 石家庄 050018) 5 (国防科技大学信息通信学院 西安 710106) (whshi0919@163.com)
语音增强旨在抑制或分离噪声,尽可能地从被噪声污染的语音信号中不失真地恢复出目标语音,改善语音的感知质量和可懂度,或作为前端提高识别准确率,在语音通信系统、听觉辅助设备和自动语音识别系统中得到了广泛的应用,是语音信号和信息处理领域的重要研究课题.过去的几十年里,众多语音增强方法相继提出,极大地推动了语音增强技术的发展.但在实际场景中,特别是在单通道、非平稳噪声环境下,由于缺乏多通道场景下的时空域参考信息且难以对语音在时频域上的结构化信息进行有效建模和利用[1],单通道语音增强仍是一个非常具有挑战性的课题.
根据是否需要语音和噪声的先验信息,现有的语音增强方法可以分为有监督和无监督两大类.经典的无监督增强方法包括谱减法、维纳滤波法和基于统计模型的方法等[2],这类方法一般是基于语音和噪声不相关且频谱系数服从高斯分布的假设,增强性能依赖于话音活动检测或噪声功率谱估计的准确性.这类方法在平稳噪声环境下一般能够取得较好的噪声抑制效果,然而在非平稳噪声或低信噪比环……
登录APP查看全文
