基于多模态特征学习的人体行为识别方法①
2021-04-23周雪雪雷景生卓佳宁
计算机系统应用 2021年4期
周雪雪,雷景生,卓佳宁
(上海电力大学 计算机科学与技术学院,上海 200090)
近年来,随着计算机视觉技术的不断发展,人体行为识别逐渐成为一个重要的研究领域,在视频监控、医疗看护、游戏应用与人机交互等方面有着广泛的应用[1].目前,人类行为主要可以基于RGB 视频[2,3],深度图[4,5]和3D 骨架[6,7]等3 种模态的特征进行识别.
尽管基于每种特征的识别技术发展迅速并取得了很多成果,当前仍然存在以下几个问题:(1)现有的人体识别算法大多是基于单一模态特征进行识别的.(2)基于RGB 视频的行为识别容易受到遮挡、环境变化或阴影的干扰;深度图中颜色和纹理的缺失容易导致相关模型识别率较低;3D 骨架由于角度、姿势以及关节点数有限等原因,容易导致动作被错检或漏检.(3)视频中存在大量与行为识别无关的画面,这些信息会降低算法的准确度.针对以上情况,本文融合RGB视频和3D 骨架两种行为信息的特征,充分利用两者的优势,同时引用注意力机制来研究行为识别.
对于RGB 视频行为特征,前人提出了一些经典的识别模型.Tran 等[8]采用3D 卷积和3D 池化构建了三维卷积神经网络(3D CNN),它可以同时提取视频行为的外观和运动特征,而且结构简单,运行速度较大多行为识别算法更快,并在UCF101 等公开数据集上取得了不错的效果.然而,3D CNN 也存在一定的技术缺陷:(1)网络的训练及测试均要求输入尺寸和比例固定的视频帧.当输入任意大小的视频时,3D CNN 会对其进行裁剪或缩放以……
登录APP查看全文
