基于唇部灰度能量图的唇读方法*
2011-03-21梁亚玲杜明辉
华南理工大学学报(自然科学版) 2011年7期
梁亚玲 杜明辉
(华南理工大学电子与信息学院,广东广州510640)
唇读是指通过观察说话者的口型变化,读出全部或者部分所说的内容[1],它是人工智能研究的一个新方向,被广泛应用于噪声环境下以提高语音识别率.基于单视觉通道的语义识别系统在近几年迅速发展起来[2-5],文中基于单视觉通道小样本大词汇唇读系统进行研究.唇读系统中待处理的数据是表示唇部变化的图像序列.由于语速的不同或者采集系统的帧率不同,对于同一个字或词在不同时间或用不同器材采集到的样本长度(帧数)是不同的,即每个样本的数据维数是不同的.目前解决此类时变信号样本数据维数不同的方法主要有两类:
(1)对每帧图像分别提取特征,利用隐马尔科夫(HMM)进行模型的训练或用动态时间规整(DTW)方法进行动态匹配识别.HMM是一种基于统计的方法,它通过对大量的样本进行模型参数的训练来获取每类的模型参数.当训练样本数较大时,模型的识别率较好;当训练样本数较小时,模型的识别率较低.DTW是一种把时间规整与距离测度计算结合起来的非线性规整技术.该方法通过计算给定的模板序列和测试序列在时间轴上的距离,将与测试序列在时间约束条件下距离最短的模板所对应的类判定为该测试样本的识别结果.DTW是一种简单易行的方法,对于训练样本的个数要求最低,每类有一个样本作为模板即可,它实质上是一种模板匹……
登录APP查看全文