基于DTW的孤立词语音识别系统设计
2018-10-16叶硕彭春堂杜珍珍贺娟
长江大学学报(自科版) 2018年17期
叶硕,彭春堂,杜珍珍,贺娟
(武汉邮电科学研究院,湖北 武汉 430000)
语音作为人类主要的通信手段,是信息获取的主要来源,无论是民用还是军事,一直以来都受到世界各国的高度重视[1]。随着互联网技术的发展,智能终端中以语音为主的交互越来越多,人们对移动设备的语音识别能力有了更高的要求。笔者设计了一种基于动态时间规整(Dynamic Time Warping, DTW)[2]的孤立词语音识别系统:以Mel频率倒谱系数(Mel Frequency Cepstrum Coefficient, MFCC)为核心,使用DTW算法对孤立词语音进行识别,通过小波变换对原始信号进行处理,提高孤立词在一定噪声环境下的识别精度,并借助MATLAB完成仿真。
1 语音识别系统设计
语音信号作为一种非平稳信号,其形成和感知的过程是一个复杂信号的处理过程[3],本质上来说,就是模式匹配的过程。语音识别的性能主要受到2个方面的影响: 一个是由环境噪声在前端随语音信号输入而产生的影响;另一个是建立的模型与语音实际的特征统计特性有差异而产生的影响[4]。
该系统识别过程包括预处理、特征提取、语音训练和语音识别4个部分,框图如图1所示。在预处理阶段对输入的语音信号进行滤波降噪、预加重、端点检测、分帧处理;在特征提取阶段对信号进行频域分析,所得参数作为语音模板,存储记录以完成语音训练;在语音识别阶段,提取输入语音信号的特征,与存储的语音模板比较,通过DTW算法进行匹配,最后根据识别决策输出相应的识别结果。

图1 语音识别系统框图
