基于自注意力序列模型的唇语识别研究
2021-07-16王媛媛吴开存
电子器件 2021年3期
王媛媛,王 沛,吴开存
(1.盐城工学院信息工程学院,江苏 盐城 224051;2.东南大学网络空间安全学院,江苏 南京 210096;3.东南大学信息科学与工程学院,江苏 南京 210096)
唇语识别是一项通过唇部视觉信息来推断视频中语音内容的任务。其在实践中具有许多关键应用,例如辅助提升语音识别性能[1],活体检测[2],改进助听器等。唇语识别任务的关键在于如何有效地捕捉唇部运动信息,同时减小由光照条件、头部姿态、说话人外表等因素而产生的噪声。
唇语识别任务存在很多难点和挑战。首先,不同语句的唇部运动差异极其微小,细粒度特征难以捕捉;其次,不同说话人的语速不同,同一段语句的时长也可能不同,需要解决长短时依赖问题;此外,上下文的冗余信息会不可避免地带入到当前语句中,影响最终的识别结果。传统的方法分为多个阶段,包括嘴唇检测,特征提取和分类器分类。其技术核心主要包括用HOG 等特征提取算法捕捉嘴唇的几何特征,利用隐藏马尔科夫模型(HMM)识别特征序列。这类方法在特征提取和时序建模方面的效果都极其有限,不具备实用性。近年来的研究中[3],卷积神经网络(CNN)可以很好地学习到与视频序列的空间特征,配合LSTM 等循环网络在时序上的建模,在唇语识别任务上取得了一定的成果,但是仍然存在一些缺点,比如不能抵抗明暗光线、皱纹、胡须等因素带来的视觉噪声,以及语速和词语边界冗余信息带来的时序建模困难的问题。
为了解决这些问题,本文设计的STCNN +Bi-GRU+Self-Attention 模型,充分考虑了唇语识别任务的复杂性和多样性。……
登录APP查看全文
