语音识别中基于发音特征的声调集成算法
2014-08-03刘志中
计算机工程与应用 2014年23期
晁 浩,宋 成,刘志中
河南理工大学 计算机科学与技术学院,河南 焦作 454000
语音识别中基于发音特征的声调集成算法
晁 浩,宋 成,刘志中
河南理工大学 计算机科学与技术学院,河南 焦作 454000
1 引言
隐马尔科夫模型(Hidden Markov Model,HMM)是当前连续语音识别领域应用最为广泛的声学模型,但其语音帧之间相互独立的假设并不符合语音信号真实分布[1]。为此,研究人员提出了分段模型,随机段模型(Stochastic Segment Modeling,SSM)就是其中的一种[2-4]。相对于HMM,随机段模型是一种更为精确的模型。此外,随机段模型作为分段模型的一种,其建模和解码均以语音段为基本单元,这就使其具有HMM所不具有的特性:段模型本身的结构允许采用语音段层次上的特征,而作为超音段特征的声调信息能很好地应用于随机段模型。为了进一步提高随机段模型系统的解码精度,将声调信息作为声学特性信息的补充用于随机段模型系统是十分必要的。
声调是汉语普通话的一种重要属性,在一定程度上承担着构字辨义的作用。因此,利用声调信息来提高声学模型的区分性是十分必要的,也是近年来的研究热点[5-8]。
对于声调模型,研究人员提出了不同的建模方法,如HMM[9]、人工神经网络[10]、决策树分类器[11]和支持向量机[12]、以及基于最大熵方法[13]和基于条件随机场[14]的声调建模方法等。从模型特征的角度,通过分析发音动作的改变对基频轮廓的影响,提出了基于发音特征和传统基频特征相结合的声调建模方法[15]。
本文的研究工作分两方面:首先进一步完善了发音器官主要动作属性划分类别,补充了发音特征集,改进了前面提出的基于发音特征的声调建模方法;……
登录APP查看全文
