一种基于多任务学习的语音关键词检测与定位方法研究*
2021-08-30王金明张宏瑜
通信技术 2021年8期
孙 渊,王金明,汪 鹏,张宏瑜
(陆军工程大学,江苏 南京 210001)
0 引言
语音流中关键词实时检测也被称为关键词检测或唤醒词检测技术,是语音识别任务中的一个分支。该技术需要从一串语音流里检测出有限个预先被定义的激活词或关键词,而不需要对整个语音流进行识别。传统的按键或鼠标输入在一定程度上限制了使用者的体验,随着人工智能的快速发展,语音交互技术成为解放使用者双手的重要技术。语音流中的关键词检测作为语音交互的基础,使用者通过预先定义的关键词来唤醒目标设备,进而发出指令实现交互。设备从唤醒到交互的过程中,使用者可以获得完全免提的体验。该技术广泛应用于智能手机、个人电脑、智能音响、智能家居和车载设备等虚拟助手中。
大词汇量语音识别系统(Large Vocabulary Continuous Speech Recognition,LVCSR)是唤醒设备的一种方法。该系统对接收到的语音信号进行解码,并在产生的解码词格中搜索预先定义的关键词从而实现设备的唤醒[1]。但LVCSR 解码需要占用较高的计算资源,并且该系统的模型庞大,用户使用过程中无可避免地会遇到时延的问题,致使LVCSR 无法部署在计算资源受限的设备端。
近年来,小规模的语音关键词检测越来越受到关注[2-5]。这是因为在低计算资源、低功耗、低延迟、长待机的嵌入式设备要求框架下,语音关键词检测系统需要在设备上持续运行,监听一定范围内所有语音流,并忽略与关键词无关的音频,在检测到关键词时立即使设备进入工作状态[6]。……
登录APP查看全文
