一种面向语音识别的抗噪SVM参数优化方法
2013-09-21白静杨利红张雪英
中南大学学报(自然科学版) 2013年2期
关键词:优化
白静,杨利红,张雪英
(太原理工大学 信息工程学院,山西 太原,030024)
语音识别技术是人机接口应用的前沿技术之一,目的是使计算机能够听懂人类语言,实现人机语音通信。但目前多数实际语音识别系统只适合识别“干净”的语音,当存在背景噪声或训练和测试环境不同时,系统性能会急剧下降。作为模式识别的新型方法之一,支持向量机(SVM)[1]能较好地解决小样本、非线性、高维数和局部极小点等实际问题,比基于经验风险最小化的隐马尔可夫模型(HMM)[2]、人工神经网络[3]等方法具有更好的泛化能力和分类精确性[4],更适合用于语音识别。关于支持向量机的理论研究在逐渐增多,但应用研究相对滞后,只在一些领域得到较好应用,如文本自动分类、图像识别、视频编码[5-6]等,近些年 SVM应用研究开始扩展到语音识别领域,但还很不够。文献[7-8]是早期的国内将支持向量机应用于孤立词和汉语数字语音识别的文献,取得了与隐马尔可夫模型相当的识别效果,但采用的是最基本的核函数,核参数选用的是经验值,并未对 SVM 中的参数选择进行描述,而且实验是在非噪音环境下进行的;Liu等[9]将SVM与段长分布HMM融合起来,构造出一种混合系统,将该系统应用到普通话数字语音识别系统中,实验是在不同信噪比下进行的,结果仅优于使用段长分布HMM的结果。在信噪比较高时,能有效改善系统性能,但在信噪比低于15 dB时,效果不好,且整个系统算法比较复杂。李攀等[10-11]将动态时间规整(DTW)算法嵌入支持向量机常用的核函数中,解决了语音段时长不一致的问题, 实现了支持向量机对语音的分类识别,但这仅是一种进行语音识别的方法,SVM的核参数仍然是最基本的经验值。……
登录APP查看全文