基于3D-CBAM注意力机制的人体动作识别
2021-03-31胡荣林
南京师范大学学报(工程技术版) 2021年1期
王 飞,胡荣林,金 鹰
(淮阴工学院计算机与软件工程学院,江苏 淮安 223003)
人体动作识别是计算机视觉领域的一项基本任务,它基于一个视频中完整的动作执行来识别人体动作[1]. 随着机器学习研究的进行,人体动作识别的方法可以大致分为两种,一种是基于机器学习人工设计特征的方法[2-3],另一种是端到端的深度学习算法. 与人工制作的动作特征不同,深度学习方法可以从图像中自主学习特征,并且学习到的动作特征比人工动作特征有更好的识别性能. Tran等[4]提出C3D网络模型,通过3D卷积直接从视频序列帧中提取时间和空间特征,但是仍然不能充分利用时间和空间特征. Simonyan等[5]提出了双流卷积网络模型,这个模型由时间和空间网络构成,空间流从静态的视频序列帧中执行行为识别,同时时间流从密集光流形式的运动中训练以识别行为,但是双流网络需要人工提取出视频帧之间的光流信息以便时间流的训练识别. 文献[6-7]通过实验表明长短期记忆网络(long short-term memory,LSTM)能够一定程度上解决卷积神经网络(convolutional neural networks,CNN)不能够表示长时间变化的问题,但是LSTM是从CNN的全连接层获取特征进行处理的,所以缺乏时空特性的细节.
针对上述的问题,本文提出了一种在C3D卷积神经网络上进行改进的融合模型. 整个动作识别流程如图1所示. 首先通过SSD目标检测方法将视频中的人体目标进行分割,然后将原视频序列帧和分割后的人体目标序列帧经过一系列的3D卷积、ConvLSTM、3D卷积……
登录APP查看全文
