APP下载

基于Ghost-SE-Res2Net 的多模型融合语音唤醒词检测方法

2024-03-21虞秋辰周若华袁庆升

计算机工程 2024年3期
关键词:特征融合检测

虞秋辰,周若华*,袁庆升

(1.北京建筑大学电气与信息工程学院,北京 102616;2.国家计算机网络应急技术处理协调中心,北京 100029)

0 引言

唤醒词检测(WWD)系统是语音助手的重要组成部分。随着“Hey Google”、“小艺小艺”和“Siri”等语音助手的出现,该系统的应用越来越广泛,携带它们的设备也越来越多样化。作为一个始终处于监听状态的系统,WWD 系统在接收到唤醒词后立即被触发,从而启用后续操作。为了降低能耗并提供流畅的用户体验,WWD 系统需具有高精度、低延迟和低内存占用率3 个特点。

WWD 可以借鉴关键词检测(KWS)的方法。早期的解决方案是基于大词汇量连续语音识别(LVCSR)[1-3],先从音频信号中检测出文本内容,再找到唤醒词进行唤醒。LVCSR 方法虽然可以灵活替换唤醒词内容,但如果在移动设备上使用,LVCSR方法占用资源大,无法满足要求。

一个轻量的替代方案是关键词/填充隐马尔可夫模型(HMM)[4-6]。目前深 度神经网络(DNN)-HMM(DNN-HMM)系统使用DNN 代替高斯混合模型(GMM)进行声学特征建模[6-8]。

对于低资源的WWD,很多基于纯粹神经网络的WWD 系统,即基于DNN 的系统不使用任何序列模型。由于不需要复杂的序列搜索算法,这些WWD 系统具有更高的计算效率。该方法最早由Google 公司在2014 年提出[9]。它直接使用全连接前馈神经网络(FFNN)来估计单词后验概率的序列,然后使用后处理方法来检测关键词。在这种范式下,许多DNN 架构被提出来替代FFNN[10-12]。DNN 的优点是可以通过改变DNN 中的参数数量来灵活地改变模型的大小,并且可以部署在硬件有限的设备上,这扩展了WWD 系统的使用场景。……

登录APP查看全文

猜你喜欢

特征融合检测
村企党建联建融合共赢
融合菜
从创新出发,与高考数列相遇、融合
《融合》
如何表达“特征”
不忠诚的四个特征
小波变换在PCB缺陷检测中的应用
线性代数的应用特征