基于元度量学习的低资源语音识别
2021-06-24侯俊龙潘文林
云南民族大学学报(自然科学版) 2021年3期
关键词:模型
侯俊龙, 潘文林
(云南民族大学 数学与计算机科学学院,云南 昆明 650500)
语音是人类学习和生活的重要交流工具,也是各民族文化传承与发展的重要载体.随着近年来大数据及设备超强运算能力的出现,各种各样的人机交互式智能产品(如智能家居、智能音箱等)逐渐走进每个家庭,给人们的生活带来了极大便利.但对于一款实用的智能化产品来说,便捷高效的人机交互方式必不可少.语音作为语言的声学表现形式,被认为是当前人类最简单、最直接的交流方式,利用语音进行人机交互极有可能成为未来智能化产品的主要交互方式.
语音识别(speech recognition)的目标是让机器理解人类语音信号并作出相应回应,它是实现语音交互的关键技术,自20世纪50年代提出以来便日益成为人工智能领域的研究热点[1].经典的研究工作有: Graves等[2]在2013年提出使用循环神经网络进行语音识别,其模型在TIMIT音素识别中取得了较好的识别效果;次年他们又提出了端到端语音识别系统,模型的泛化性能得到了更进一步的提升[3];2016年百度提出了端到端的深度学习方法,能够很好的识别出汉语或英语[4];同年微软提出结合使用LSTM和卷积神经网络来进行语音识别,其精度达到了人类识别效果[5].但从可见文献看来,现有研究工作大多局限于汉语或英语等国际主流语言,究其原因是这些语言资源丰富,在语音识别研究中很容易获取到大量语料用于模型训练.然而,在当前参……
登录APP查看全文