基于不确定性感知的语音分离方法*
2021-03-12涂斌炜吕俊
自动化与信息工程 2021年1期
涂斌炜 吕俊
技术应用
基于不确定性感知的语音分离方法*
涂斌炜 吕俊
(广东工业大学自动化学院,广东 广州 510006)
为抵御噪声的干扰,提出一种基于不确定性感知的语音分离方法。在训练阶段,采用双链路架构分别学习噪声和语音源成分的编解码子网和分离子网;在测试阶段,以闭式解的形式自适应更新噪声编码子网,减小训练与测试噪声在特征空间的均值偏移,降低认知不确定性,并尽量保持重要参数不变,间接限制语音分离的经验误差。在公开数据集LibriSpeech, NoiseX和NonSpeech上的实验结果表明:本文提出的方法能够快速有效地提高噪声干扰下语音分离的尺度不变信噪比。
语音分离;噪声干扰;不确定性感知
0 引言
语音分离一词最初源于“鸡尾酒会问题[1]”,是指从混合的两个或多个说话人的声音中得到想要的目标说话人(一人或多人)的语音信号,广泛应用于语音识别、情感识别或翻译等任务的前端处理。按信号输入的通道数划分,语音分离可分为单通道语音分离和多通道语音分离2种。本文主要讨论单通道语音分离技术。
单通道语音分离技术又分为有背景噪声和无背景噪声2类。无背景噪声的单通道语音分离技术发展较早,常见方法包括基于听觉场景分析[2]、基于非负矩阵分解[3-4]和基于深度神经网络的语音分离方法[5-6]。这些方法推动了单通道语音分离技术的发展,但没有考虑噪声干扰的影响,与真实使用场景相差较大。
近年,许多专家学者逐渐关注有背景噪声的单通道语音分离技术。……
登录APP查看全文
