基于时空采样的卷积长短时记忆网络模型及其应用研究
2018-06-28闭世兰
闭世兰
(中南民族大学生物医学工程学院,湖北武汉430074)
0 引言
近年来,基于机器学习的方法作用于人体动作识别取得了卓越的成效,其中以计算机模拟生物体神经系统视觉感知机制的深度学习法最为有效。然而,人体动作在空域和时域上呈现不可分割性,但现有的动作识别方法主要采用纯粹提取单域信息或时空信息分离处理的技术来实现人体动作识别,从而导致识别性能仍然不太理想。
众所周知,卷积神经网络(CNN)在视觉皮层的多级处理的启发下可以自动学习特征,模拟视频空间相关性效果最好。
Ji Shuiwang等人将传统的CNN扩展到3D-CNN以捕捉视频中的空间时间特征[1],但识别精度不理想且增加了学习的复杂性。
研究者为了提取视频的时域特性,提出将循环神经网络(RNN)[2]及长短时记忆网络LSTM[3]应用于动作识别,V.Veeriah等人在研究中提出微分式循环神经网络dRNN模型[4],使用密集取样的HOG3D特征,并证实了循环神经网络的记忆能力,然而LSTM忽略了帧中局部像素之间的空间相关性。
为了同时利用CNN与LSTM的优势,研究者考虑将RNN或LSTM模型与CNN结合,生成CNNRNN(CNNLSTM)模型,它的基本架构是CNN序列特征作为输入引入到LSTM模型中。
M.Baccouche等人在科研中使用3D-ConvNet+LSTM、3DCNN+Voting两种组合方式,取得了较高的准确性[5]。
虽然这些模型可以解决动作识别的问题,但是在模型的两个不同阶段,它们分别考虑了空间性和时间性,然而空间性和时间性是生物体运动识别不可分割的特性。
为了揭示动作识别的本质特征,专注于时空信息相关性,必须将时间相关的LSTM网络融合到二维CNN中,实现空间和时间不可分割的功能,Shi Xingjian等人将完全连接的LSTM扩展到卷积LSTM[6]。……
