工业噪声环境下多麦状态空间模型语音增强算法
2020-06-07吴庆贺吴海锋
计算机应用 2020年5期
吴庆贺,吴海锋,沈 勇,曾 玉
(云南民族大学电气信息工程学院,昆明650504)(通信作者电子邮箱whf5469@gmail.com)
0 引言
语音是语言的声学表现,是人类交流信息最自然和最方便的形式。在很多工业环境中,大型设备的作业往往需要多人协同操作,比如一人根据作业环境发出指令,一人根据指令进行操作,而语音通信就成为相互协作中有效的沟通方式。然而,语音不可避免受到环境噪声的干扰,特别当大型设备的动力系统和作业系统所产生的声音强度远远大于语音强度时,相互通信的有效性就会产生影响,严重时还会产生通信失效,导致协同作业的失败。语音增强是通过减轻或抑制背景噪声来相对提高语音功率的一种技术,由于它能减小噪声对通信双方所产生的干扰,因此广泛应用于噪声环境的语音通信场景[1-3]。
早期的语音通信设备常采用单麦克风设计,因此其语音增强也基于单麦技术[1-5]。单麦语音增强由于只使用一个麦克风,缺少参考信号,导致直接从带噪语音中估计的语音与真实语音差异较大,语音增强效果受到影响[4]。为了更准确地估计语音,一种可行的方法是用自回归(AutoRegression,AR)对语音进行状态空间模型(State Space Model,SSM)建模,再用卡尔曼滤波解决该AR模型(AR-Kalman)[5-7]。该方法的性能往往与AR系数的阶次相关,只有较高的阶次才能准确恢复语音,但这又会使得语音增强的计算复杂度增高。多麦克风技术是在语音设备的不同位置配备多个麦克风,相当于产生了多个通道的语音信号[8-9]。……
登录APP查看全文
