APP下载

面向视频中人体行为识别的复合型深度神经网络

2022-07-12尚瑞欣钱惠敏

模式识别与人工智能 2022年6期

黄 敏 尚瑞欣 钱惠敏

视频人体行为识别研究旨在识别并描述视频中人体的运动模式并进一步分析行为暗含的情感和目的.此研究在视频检索、人机交互、医疗保健、智能安防等领域具有广泛的应用前景.随着深度学习在计算机视觉研究中的发展,基于深度学习的人体行为识别方法因其良好的泛化性能,逐渐替代基于手工设计特征的人体行为识别方法和基于浅层机器学习的人体行为识别方法[1-2].

随着视频传输技术的发展和各类视频软件的出现,用于人体行为识别的视频数据也越来越多,小型、中型、大型和超大型数据集相继出现.例如,小型数据集HMDB51(Human Motion Database)[3]包含51类行为,视频量不过万条;中型数据集UCF101(Uni-versity of Central Florida)[4]包含101类行为,视频量有1万多条;大型数据集Kinetics-400[5]包含400类行为及30万多条视频;超大型数据集IG-65M[6]、Sports-1M[7]等包含高达百万级的视频量.而这些视频数据中的人体行为的多样性,如人体的自遮挡和被遮挡、动态背景、视角和光照变化等,使视频中的人体行为识别仍面临诸多挑战.

在基于深度学习的人体行为识别研究中,目前最常用的网络架构为三维卷积神经网络(简称3D网络)[8-12]和双流卷积神经网络(简称双流网络)[13-17].3D网络旨在从三维视频数据(含有多帧图像的视频段)中学习人体行为的特征表示,识别行为类型.但是,随着视频数据的增加,往往需要更深的3D网络学习人体行为的特征表示,从而使网络因参数量过大而难以训练.针对此问题,Carreira等[9]提出I3D(Two-Stream Inflated 3D ConvNet),将迁移……

登录APP查看全文