唇语识别的视觉特征提取方法综述
2021-12-13马金林巩元文马自萍陈德光朱艳彬刘宇灏
计算机与生活 2021年12期
马金林,巩元文,马自萍,陈德光,朱艳彬,刘宇灏
1.北方民族大学 计算机科学与工程学院,银川 750021
2.图像图形智能处理国家民委重点实验室,银川 750021
3.北方民族大学 数学与信息科学学院,银川 750021
唇语识别是通过分析一系列唇部运动信息来推断说话者所说内容,涉及模式识别、语音处理、图像分类和自然语言处理等多个领域[1],具有广阔的应用前景。早期的唇语识别系统采用人工标注特征作为唇部视觉特征,一系列图像序列作为模型输入,此类方法仅保证了下游任务能进行分类识别,而不考虑获取特征的有效性,因此下游任务识别精度通常较低。近年来,随着人类需求的增加,仅采用图像序列作为模型输入的唇语系统获取的视觉效果远不能达到人类的期望值,人们开始寻求有效的视觉特征。
唇语识别系统一般由视觉特征提取和分类识别两个阶段组成,唇部视觉特征提取的有效性是下游任务获取良好表现的关键。理想情况下,视觉特征应包含足够多对识别有效的信息量,并对视频中的噪声表现出一定程度的鲁棒性[2]。但头部姿势、光照条件、视频拍摄角度等因素对提取的视觉特征质量具有很大的影响。因此,多年来学者们一直致力于对高效唇部视觉特征的研究。本文将唇部视觉特征提取方法分为传统提取方法和深度学习提取方法两类,这两类视觉特征提取方法的架构如图1 所示。
如图1(a),传统的视觉特征提取方法主要依靠人工标注,存在易受外界环境影响,耗时长、效率与精度低的问题。……
登录APP查看全文