语音识别中说话人自适应方法研究综述
2021-12-13朱方圆马志强张晓旭王洪彬宝财吉拉呼
朱方圆,马志强,2+,陈 艳,张晓旭,王洪彬,宝财吉拉呼
1.内蒙古工业大学 数据科学与应用学院,呼和浩特 010080
2.内蒙古工业大学 内蒙古自治区基于大数据的软件服务工程技术研究中心,呼和浩特 010080
自动语音识别(automatic speech recognition,ASR)是一种将语音序列转化成文本序列的技术,是人机交互的主要方式之一[1]。当ASR 系统的测试条件和训练数据不匹配时,其识别性能下降明显,主要包括以下几个原因:说话人的差异、声学环境的可变性和使用领域的不同。研究人员提出利用说话人自适应(speaker adaptation,SA)方法对说话人声学特性进行适应,主要是对特征提取和声学模型(acoustic model,AM)的修正和调节。利用说话人的若干数据,对说话人无关(speaker independent,SI)的语音识别系统进行调节,调节后系统对目标说话人的识别性能提升。
ASR 的说话人自适应任务是将一系列声学特征向量X={x1,x2,…,xt,…,xT},利用目标说话人的若干数据得到参数θE,使xt∈Rd映射到单词序列W。假设模型以框架方式运行,则可以将模型定义为:

其中,f(xt;θ;θE)是具有参数θ和参数θE的神经网络模型,yt是帧t的输出标签。传统的高斯混合模型-隐马尔可夫模型(Gaussian mixed model-hidden Markov model,GMM-HMM)语音识别系统的说话人自适应技术主要包括:最大似然线性回归(maximum likelihood linear regression,MLLR)[2-4]、特征层最大似然线性回归(feature-space maximum likelihood linear regression,fMLLR)[5-6]、最大后验概率线性回归(maximum a posteriori,MAP)[7-8]和声道长度规整(vocal tract length normalization,VTLN)[9-11]等。虽然GMM-HMM 语音识别系统的说话人自适应方法已经非常成熟,但GMM是一个生成式模型,通过对空间进行划分,利用权重和方差等描述声学单元特性;而神经网络(neural network,NN)是一个判别式模型,直接对后验概率进行建模来实现。……