APP下载

基于复值掩蔽与扩张卷积的实时语音增强方法∗

2021-07-16孙世若

电子器件 2021年3期
关键词:模型

朱 明,孙世若

(1.盐城工学院信息工程学院,江苏 盐城 224051;2.东南大学信息科学与工程学院,江苏 南京 210096)

现实中的语音信号总是会受到各种干扰与污染,语音增强是从被噪声污染的语音信号中提取干净语音的技术,目的是提高语音的可懂度与质量,其在语音通信、自动语音识别系统前端等有着广泛的应用。近些年,随着深度学习的发展,更多前沿的有监督深度学习方法被引入到语音增强技术中。

然而,深度学习的网络模型通常包含大量的矩阵运算,这使得它必须依靠GPU 进行推理计算。另一方面,许多基于深度学习方法的语音增强模型都是非因果系统,使得它们无法在实时系统当中应用。Valin[1]提出了一种实时DSP 和深度学习的混合方法,使用循环神经网络估计理想频带增益,可以满足实时因果系统的要求。然而,这种方法只对语音的幅值谱进行了处理而忽略了相位的作用。受此启发,本文提出了一种基于复值掩蔽与扩张卷积的语音增强方法对含噪语音进行实时增强处理。通过与基线模型对比来验证模型对语音增强性能的改善。

1 网络结构与优化

本文所提出的网络主要由编码器-解码器和门控扩张卷积模块构成,如图1 所示,其中编码器包含5 层卷积层,解码器分为实部和虚部解码器,分别包含5 层反卷积层。编码器和解码器中间包含5 层门控扩张卷积。

图1 网络结构

1.1 编码器-解码器

编码器-解码器网络只包含卷积和反卷积操作,并且为了满足因果系统的要求,所有卷积核的尺寸设置为3×1,即频率维度对应的卷积核尺寸为3,时间维度对应的卷积核尺寸为1。……

登录APP查看全文

猜你喜欢

模型
一半模型
一种去中心化的域名服务本地化模型
适用于BDS-3 PPP的随机模型
函数模型及应用
p150Glued在帕金森病模型中的表达及分布
函数模型及应用
重尾非线性自回归模型自加权M-估计的渐近分布
3D打印中的模型分割与打包
FLUKA几何模型到CAD几何模型转换方法初步研究
一个相似模型的应用