基于Viterbi 解码技术的智能语音交互算法研究
2021-06-14黄小奇陈光文许卓伟方志丹
电子设计工程 2021年10期
黄小奇,范 晟,陈光文,许卓伟,彭 锴,方志丹,王 烁
(广东电网有限责任公司汕头供电局,广东汕头 515000)
语音交互作为最方便、易学的人机交互方式,已开始尝试应用于智能家居、车载系统、智能手机等电子产品领域[1-2]。然而,语音交互技术的真正成熟应用还需克服众多困难,尤其是在语音识别上。如实用与训练环境通常存在巨大的差异,导致实际使用过程中语音识别率较低;或者语用层、声学层和语言层的语音识别能力与人类相比仍有较大差距;亦或是人类通常在交流中存在笑声、咳嗽、哭泣等非正常语音现象与重复、停顿等不规则语言现象,导致语音识别误差较大[3-5]。因此,如何使用合适的语音交互算法准确识别实际环境下人类的语言,是提高语音识别率的关键。
实际上,在人类交流的过程中,通常只需要通过几个关键词就可以正确推断出谈话的核心内容,而不需要对连续语音进行辨析与识别,这为语音识别提供了思路[6-7]。目前,基于语音关键词的识别过程主要有基于垃圾模型、基于音素与音节识别、基于连续语音识别共3 类关键词识别结构[8]。3 类识别结构有各自的优势和弊端,因此,文中将音素、音节与连续语音识别相结合,将后者结构中的网格(词网格)用音素、音节的网格进行替代。基于核心的Viterbi 搜索解码技术,结合前端处理、声学与语言模型,设计了面向汉字的智能语音交互算法。该算法主要侧重于语音识别的关键词检测,并在交互平台上进行整合测试。……
登录APP查看全文
