基于深层神经网络的多特征关联声学建模方法
2017-05-13范正光闫红刚张文林
范正光 屈 丹 闫红刚 张文林
(解放军信息工程大学信息系统工程学院 郑州 450002)(fanzg11@163.com)
基于深层神经网络的多特征关联声学建模方法
范正光 屈 丹 闫红刚 张文林
(解放军信息工程大学信息系统工程学院 郑州 450002)(fanzg11@163.com)
针对不同声学特征之间的信息互补性以及声学建模中各任务间的关联性,提出了一种多特征关联的深层神经网络声学建模方法,该方法首先借鉴深层神经网络(deep neural network, DNN)多模态以及多任务学习思想,通过共享DNN部分隐含层为不同特征声学模型间建立关联,从而挖掘不同学习任务间隐含的共同解释性因素,实现知识迁移以及性能的相互促进;其次利用低秩矩阵分解方法减少模型估计参数的数量,加快模型训练速度,并对不同特征的识别结果采用ROVER(recognizer output voting error reduction)融合算法进行融合,进一步提高系统识别性能.基于TIMIT的连续语音识别实验表明,采用关联声学建模方法,不同特征的识别性能均要优于独立建模时的识别性能.在音素错误率(phone error rates, PER)指标上,关联声学建模下的ROVER融合结果要比独立建模下的ROVER融合结果相对降低约4.6%.
语音识别;深层神经网络;声学模型;低秩矩阵分解;融合
在现代连续语音识别(continuous speech recognition, CSR)系统中,声学特征提取是一个必不可少的模块,其性能直接影响系统的识别能力和鲁棒性.理想的声学特征应一方面能表征不同识别基元的声学差异,另一方面又能表征不同样本间相同识别基元的声学相似性信息等[1].然而,要得到一种满足这些特性的……
