面向语音增强的双复数卷积注意聚合递归网络
2023-10-21余本年詹永照毛启容董文龙刘洪麟
计算机应用 2023年10期
余本年,詹永照*,毛启容,2,董文龙,刘洪麟
面向语音增强的双复数卷积注意聚合递归网络
余本年1,詹永照1*,毛启容1,2,董文龙1,刘洪麟1
(1.江苏大学 计算机科学与通信工程学院,江苏 镇江 212013; 2.江苏省大数据泛在感知与智能农业应用工程研究中心,江苏 镇江 212013)( ∗ 通信作者电子邮箱yzzhan@ujs.edu.cn)
针对现有的语音增强方法对语谱图特征关联信息表达有限和去噪效果不理想的问题,提出一种双复数卷积注意聚合递归网络(DCCARN)的语音增强方法。首先,建立双复数卷积网络,对短时傅里叶变换后的语谱图特征进行两分支信息编码;其次,将两分支中编码分别使用特征块间和特征块内注意力机制对不同的语音特征信息进行重标注;再次,使用长短期记忆(LSTM)网络处理长时间序列信息,并用两解码器还原语谱图特征并聚合这些特征;最后,经短时逆傅里叶变换生成目标语音波形,以达到抑制噪声的目的。在公开数据集VBD(Voice Bank+DMAND)和加噪的TIMIT数据集上进行的实验的结果表明,与相位感知的深度复数卷积递归网络(DCCRN)相比,DCCARN在客观语音感知质量指标(PESQ)上分别提升了0.150和0.077~0.087。这验证了所提方法能更准确地捕获语谱图特征的关联信息,更有效地抑制噪声,并提高语音的清晰度。
语音增强;注意力机制;复数卷积网络;编码;长短期记忆网络
0 引言
语音增强是一种从有噪声的语音信号中提取尽可能纯净的语音信号的技术,该技术可以提高语音的客观感知质量和可懂度。语音增强在移动通信、语音助听和语音识别预处理等方面都有广泛的应用前景。……
登录APP查看全文
