一种基于PCA的段级特征*
2011-03-21张兴明王科人黄山奇
张兴明,王科人,黄山奇
(国家数字交换系统工程技术研究中心,河南郑州450002)
一个典型的说话人识别系统提取的说话人特征通常为时变特性参数如梅尔倒谱系数MFCC(Mel-Frequency Cepstrum Coefficients)[1]、感知线性预测系数PLP(Perceptual Linear Prediction)[2]或韵律特征[3]。然而,实际使用时由于受到噪音干扰,或者训练与识别传输通道不匹配,识别系统通常不能表现良好[4]。目前解决这一问题的手段主要集中在特征域、模型域和得分域。现有特征域鲁棒性处理方法主要有:RASTA滤波[5]、倒谱均值归一化(CMN)[6]、直方图均衡[7]和倒谱规整[8-11]等。这些算法通常以在识别前增加额外的运算来换取鲁棒性的提高,如统计概率密度分布及计算各阶矩等。
本文算法主要从特征域入手,旨在减少识别阶段运算时间的同时提高识别系统的鲁棒性。参考文献[12]采用了观察值的各阶矩和中心矩作为段级特征,并与模型结合,在不显著影响识别率的情况下提高了识别速度。其缺点是,采用段级特征与采用帧级特征相比较识别率较低。参考文献[13]提出了一种改进的PCA方法用于掌纹识别,通过提取更有利于分类的基向量,提高了降维后特征的鲁棒性。本文结合了两者的优点,提出了一种基于PCA的段级特征PCAULF(PCA based Utterance Level Feature)提取算法。该算法特点如下:
(1)以段级特征代替帧级特征,可减少识别过程中模板匹配的次数,通过减少运算量来提高识别速度;
(2)在段级特征降维时引入改进的PCA算法,一方面实现了数据的降维,既抑制了噪声对识别系统的影响,又提高了识别的速度;另一方面,选择更利于分类的特征向量组成变换矩阵,提高识别系统的鲁棒性。……
