APP下载

基于区分加权干扰属性投影的语种识别方法

2012-06-29刘伟伟吉立新李邵梅何赞园

中文信息学报 2012年6期
关键词:信息

刘伟伟,吉立新,李邵梅,何赞园

(解放军信息工程大学 信息工程学院,河南 郑州 450002)

1 前言

语种识别是判别一段语音信号所属语言种类的过程。作为语音识别和其他相关应用的前端处理,语种识别技术在多语种信息服务、多语种机器翻译、军事及安全等领域都有着重要的应用。在语种识别系统处理中,语音信号包含不同信道、说话人及方言等复杂的信息,如何消除和抑制这些因素的影响,是提高系统鲁棒性的关键。

高斯混合模型超矢量—支持向量机(Gaussian Mixture Model Super Vector-Support Vector Machine, GSV-SVM)[1-2]是目前应用最为广泛的语种识别和说话人识别声学模型,针对该模型中训练测试失配的问题,干扰属性投影(Nuisance Attribute Projection, NAP)[3]已做了卓有成效的研究。NAP的基本思想是,利用训练数据估计训练和测试失配子空间,并通过投影去除失配子空间。目前,针对NAP的研究主要局限于去除信道影响方面的应用,且投影矩阵的训练需要繁杂的参数调整和大量的标注语料[4],这些限制导致该方法难以实现,且在投影去除信道影响时会不可避免地删除部分有价值的信息,因此NAP并未得到广泛的应用。

本文提出一种区分加权干扰属性投影(Discriminating Weighted Nuisance Attribute Projection, DWNAP)算法,该算法首先利用各语种训练语音的GSV,统计其协方差矩阵特征值的离散度,用来估计影响语种识别的非语种信息(如信道、说话人、麦克及环境等),即“干扰源”。此干扰源的估计值代表该语种训练语音受“噪声”污染的程度,干扰源大说明该语种的训练语音内包含更多的信道、说话人等语种无关的信息。……

登录APP查看全文

猜你喜欢

信息
订阅信息
展会信息
信息超市
展会信息
展会信息
展会信息
展会信息
展会信息
信息
健康信息