APP下载

可穿戴设备上的人声分离研究

2021-12-13蒋非颖张佳敏

科学技术创新 2021年33期
关键词:信号

蒋非颖 张佳敏

(1、北京儒博科技有限公司,北京 100000 2、成都大学肉类加工四川省重点实验室,四川成都 610106)

在语音识别中的多人对话场景,需要把说话人各自的语音分开才能有效加以识别,混在一起的语音识别不了。目前一个比较常用的应用场景是用于智能多人会议识别转写系统,一个麦阵设备放在参会者中间来拾取和分离、识别语音。其普遍使用的算法是基于麦阵多波束成形按说话人空间方向来分离[1],典型的如微软Azure IoT Edge 使用的“黑塔”会议系统,用12个波束,覆盖360°的方位。或者训练深度神经网络来做单通道盲分离[2-4]。将其结合的多通道神经网络语音分离架构是目前热点的研究方向[5,6]。这种主要用于多人会议场景的外置麦阵拾音设备使用场景固定,它需要有地方放置,不方便移动携带。相比而言可穿戴的小型设备更为灵活方便,广泛适用于例如服务员和顾客,医护和患者等之间的对话的拾音来分离识别。

基于设置较多固定波束的波束成形算法以及基于深度神经网络的分离算法往往需要比较大的算力和存储空间,其本地设备主要用于拾音,计算一般放在云端进行,因此用于有无线信号覆盖的在线场景。而可穿戴设备具有可移动性,有支持离线处理的需求,算法要能在本地嵌入式端进行。而且使用电池供电,也有省电、低功耗的需求。因此算力和存储都有限,需要低复杂度的分离算法。

本文研究了在一种基于增强干扰语音抑制的人声分离的算法,使用了最少一个麦阵波束和一个自适应噪声对消模块,以较小的算力消耗在一种可穿戴设备,智能胸牌上达到了较好的人声分离的效果。……

登录APP查看全文

猜你喜欢

信号
信号
完形填空二则
7个信号,警惕宝宝要感冒
孩子停止长个的信号
《铁道通信信号》订阅单
基于FPGA的多功能信号发生器的设计
基于Arduino的联锁信号控制接口研究
《铁道通信信号》订阅单
基于LabVIEW的力加载信号采集与PID控制
Kisspeptin/GPR54信号通路促使性早熟形成的作用观察