CHMM语音识别初值选择方法的研究
2012-03-22刘伶俐王朝立
上海理工大学学报 2012年4期
刘伶俐, 王朝立, 于 震
(上海理工大学光电信息与计算机工程学院,上海 200093)
隐马尔科夫模型(HMM)作为语音信号的一种统计模型,语音识别效果好,能够很好地描述语音信号的特点,在数字语音处理中应用非常广泛.
HMM包括离散的模型(DHMM—Discrete HMM)、连续混合密度模型(CHMM—Continuous HMM)以及半连续模型(SCHMM—Semi-Continuous HMM).相比较DHMM,CHMM系统识别率更高,这是由于在CHMM中输入向量X即观察值向量,不需要经过矢量量化转变,这个输入向量直接就是每一帧语音信号的特征矢量.基于CHMM系统识别率高的特点,它的应用非常广泛.文献[1]给出了基于性别的CHMM语音识别方法,文献[2]研究了驾驶员意图识别的可能性,文献[3]讨论了基于声音的轴承故障诊断等.
在HMM模型建立后用Baum-Welch迭代算法求解HMM模型,其中一个重要的问题就是初始模型的选取[4],不同的初始参数模型将产生不同的训练结果与识别结果.关于DHMM初值的研究,文献[5]说明了DHMM初始参数选择的一般规律和最佳选择方法,但是CHMM的初始参数至今还没有一个最佳的选择方法.传统CHMM参数初始化方法是随机分布之值、K均值算法,但是由于K-means方法存在对初始中心的依靠较重、对孤立点影响较大和聚类结果不稳定的缺点[4,6],因此,有人提出了对初值中心选择的改进方法:基于密度的方法[7]和最大最小距离法[8].基于密度的方法首先去除孤立点,在密度所在的区域内随机选择初始中心,但是密度相似性大小相差较大时,聚类结果不好;而最大最小距离方法虽然可以使类间相似……
登录APP查看全文
