Transformer在语音识别任务中的研究现状与展望
2021-09-13张晓旭马志强刘志强朱方圆王春喻
张晓旭,马志强,2+,刘志强,朱方圆,王春喻
1.内蒙古工业大学 数据科学与应用学院,呼和浩特010080
2.内蒙古自治区基于大数据的软件服务工程技术研究中心,呼和浩特010080
自1960年以来,语音识别(automatic speech recognition,ASR)作为一种非常自然的人机交互方式一直是机器学习领域中的重要研究内容[1],同时也是开启人工智能时代的关键一步。因此,人们对语音识别进行了广泛的研究。
语音识别任务是把长度为T的语音序列X=x1,x2,…,xT转写成长度为N的字符或者字母的标签序列L=l1,l2,…,lN,即给定X的条件下使标签和音频的条件概率最大化:

其中,xt∈RD表示序列X中的第t位语音帧,每位语音帧是一个D维的语音向量;li∈V表示序列L中位置i的标签,V表示字符或字母的标签集合;V*表示由V中字符或字母组成序列的集合。由此可知,ASR的主要工作是建立一个可以准确计算后验分布p(L|X)的模型[2]。
对于语音识别模型,首先从基于隐马尔可夫(hidden Markov model,HMM)模型的语音识别开始探究,通过结合高斯混合模型(Gaussian mixed model,GMM),使其对语音的观察概率进行建模,HMM 则对语音的时序进行建模,使基于HMM的语音识别模型的识别效果得到提升,因此高斯混合模型-隐马尔可夫模型(Gaussian mixed model-hidden Markov model,GMM-HMM)在20世纪90年代以前一直是语音识别的主流模型。但是基于GMM-HMM 模型的语音识别系统整体效果还远远达不到在业界应用的水平,语音识别的研究陷入了瓶颈。随着深度学习技术的发展,尤其是深度置信网络(deep belief network,DBN)解决了深度神经网络(deep neural network,DNN)训练过程中的容易陷入局部最优的问题后,人们开始对HMM 结合DNN 的语音识别模型进行探究。……