基于视频深度学习的时空双流人物动作识别模型
2018-05-21杨天明岳文静
计算机应用 2018年3期
杨天明,陈 志,岳文静
(1.南京邮电大学 计算机学院,南京 210023; 2.南京邮电大学 通信与信息工程学院,南京 210003)
0 引言
深度学习被运用于图片分类[1-3]、人物脸部识别[4]和人物位置预测[5]等识别领域。视频人物动作识别可看作随时间变化图片的分类问题,所以图片识别的深度学习方法也被大量使用在视频人物动作识别研究中[6-8]。与计算机视觉的其他领域相比,深度卷积神经网络(Convolutional Neural Network, CNN)在动作识别领域的表现并不突出,原因有以下两点:第一,现今视频数据集较小并且噪声信息较多。视频中目标的移动以及视角的变化增加了动作识别的难度,所以需要比图片识别更多的训练样本。图片数据集ImageNet每一类具有1 000个例子,而视频数据集比如佛罗里达大学YouTube行为数据集(University of Central Florida YouTube action dataset 101, UCF101)每一类仅仅有100个例子,比图片数据集少很多。第二,传统卷积神经网络结构不能充分地提取时间特征。视频是一种按时变化数据,任意像素与其邻域像素之间的相似性很大,具有很强的时间相关性与空间相关性,具有时空特征。然而卷积神经网络通常用于单一、静止的图片,不能有效地提取出连续帧之间的关联特征。
为了利用视频的时间特征,文献[9]提出了一种时空双流结构,该结构包含两个并行卷积神经网络结构。两个卷积神经网络分别以等间隔抽样视频帧和视频的一系列光流图片作为输入,提取视频人物动作的空间以及时间信息,最后将这两方面信息融合用以辨别视频人物动作类别;……
登录APP查看全文
