基于瓶颈复合特征的声学模型建立方法
2020-11-14郑文秀赵峻毅文心怡姚引娣
郑文秀,赵峻毅,文心怡,姚引娣
(西安邮电大学 通信与信息工程学院,西安 710121)
0 概述
近年来,随着语音识别技术的迅速发展,特别是深度神经网络(Deep Neural Networks,DNN)在大词汇量连续语音识别中的成功应用,使语音的识别正确率得到了很大的提升。语音识别系统一般包含特征提取、声学模型和解码识别3个部分[1]。特征提取是将原始数据中提取有利于后续过程中语音识别的部分特征,消除大量冗余信息,对这些特征进行降维和去噪处理[2]。声学模型训练利用特征和标注训练模型来区分隐马尔科夫模型(Hidden Markov Model,HMM)状态,包括高斯混合模型(Gaussian Mixture Model,GMM)、深度信念网络(Deep Belief Networks,DBN)[3]、深度神经网络[4]和瓶颈-高斯混合模型(BottleNeck-GMM,BN-GMM)。
在DNN-HMM声学模型之前,GMM-HMM声学模型具有完善的理论知识体系,训练效率较高。传统的语音识别声学模型采用梅尔频率倒谱系数(Mel-Frequency Cepstral Coefficient,MFCC)特征对GMM-HMM进行建模。但是MFCC特征具有短时的特性,容易受到环境中噪声的影响,鲁棒性较差,忽略了连续帧之间的相关特性[5]。为利用GMM-HMM的性能优势,文献[6-7]研究了一种具有狭窄中间层的瓶颈深度神经网络,从神经网络的瓶颈层提取BN特征来代替MFCC特征,并应用于GMM-HMM声学模型训练,构造出BN-GMM-HMM,实验结果表明,该模型与DNN-HMM声学模型相比具有相当的识别能力。
本文将深度神经网络提取的语音长时相关性和紧凑性特征与传统MFCC特征相结合,构造一种新的复合特征参数流系统。该系统采用成熟的GMM-HMM声学模型,并利用复合特征参数流进行GMM-HMM模型的重构,以提升系统的识别率。
1 声学特征的提取
1.1 基于深度神经网络的瓶颈特征提取
2007年,GREZL等人[8]提出瓶颈的概念并在连续语音识别中成功应用。……
