基于时空双流融合网络与Attention模型的行为识别
2020-09-02马翠红毛志强
计算机应用与软件 2020年8期
王 毅 马翠红 毛志强
(华北理工大学电气工程学院 河北 唐山 063210)
0 引 言
人体行为识别是基于收集的视频序列来分析人体的运动,并广泛应用于智能视频监控、健身评估、人机交互、虚拟现实等领域,成为人工智能领域研究的热点问题[1-2]。
传统的人体行为识别主要是基于手工特征的方法,然而传统方法进行特征提取的步骤繁琐且难以提取到深层特征,使得行为识别准确率难以提升。近年来,随着深度学习被广泛应用于图片分类、人脸识别和目标检测等识别领域,其在人体行为特征提取上也表现出了很好的效果。2014年,Karpathy等[3]首次利用深度卷积网络以连续的RGB视频帧为输入,实现人体行为识别,但并没有很好地利用时间域特征;Simonyan等[4]利用双流卷积网络分别提取视频序列中的时间和空间特征,识别精度虽然有了明显提升,但由于该网络结构使用的是传统Softmax和SVM进行人体识别,其识别准确率并不高。
在文献[4]的基础上,本文对其网络结构进行改进,在双流卷积网络基础上构建双向长短时记忆网络(Bi-LSTM)提取时序特征;输入Attention层自适应地对相关的特征向量分配较大的权重,利用Softmax分类器对视频进行分类,从而实现人体行为识别。
1 模型架构
卷积神经网络(CNN)主要用于单一静态图片特征的提取,很难提取视频的时间信息。文献[4]提出了双流卷积识别网络,与以往的视频中人体行为识别方法相比,有效地利用了视频中的时间信息,但仍存在一些问题:双流结构提取的时空特征仅在最后的Softmax层进行融合,没有考虑到时空特征在卷积层和全连接层之间的关联性;……
登录APP查看全文
