基于多普勒雷达的发音动作检测与命令词识别
2020-05-09吴鹏飞凌震华
小型微型计算机系统 2020年2期
吴鹏飞,凌震华
(中国科学技术大学 语音与语言信息处理国家工程实验室,合肥 230027)
1 引 言
语音是从肺部呼出的气流通过声门、声道等各种器官作用而产生的,人类在发音时需要调动多个发音器官,如软腭、舌、牙齿、唇等[1].发音器官在发音过程中的位置和运动称作发音动作特征(articulatory feature).发音动作特征相对于语音的声学特征具有变化缓慢、可解释性强、不易受声学噪声影响等优点[2],因此已有研究人员将发音动作特征应用到语音识别和语音合成方法的研究中,以提高噪声环境下的识别准确率[3]、实现静默语音接口[4]和增强合成语音的自然度与灵活可控性[5]等.
发音动作特征可以用多种技术手段采集,例如X射线微束影像[6]、磁共振成像[7]、图像采集外部发音器官运动[8]、表面肌电[9]及电磁发音仪[10]等.这些发音动作特征采集手段虽然能有效检测发音器官运动,但往往存在侵入人体、非便携、成本高等问题.近年来,基于微波雷达的面部姿态[11]和舌部动作识别[12]方法被提出,这些方法利用微波雷达的多普勒特性检测面部肌肉的微小动作,在简单的面部动作和舌部动作识别任务中取得了良好的性能.微波雷达采集方法具有无侵入性、成本低等优点,且适用静默语音场景,因此本文使用多普勒微波雷达采集发音动作,研究基于所采集动作的命令词识别方法.相对于先前的简单舌部动作检测任务[12],命令词识别中发音动作特征的组合模式更加复杂;相……
登录APP查看全文
