多时间尺度双流CNN与置信融合的视频动作识别
2021-05-28詹永照
江苏大学学报(自然科学版) 2021年3期
陈 洁,詹永照
(江苏大学 计算机科学与通信工程学院,江苏 镇江 212013)
近年来,在通信技术和手机APP大发展的环境下,视频已经成为人们分享状态和表达情感的主要形式之一,网络中的视频数量呈爆发式增长,视频类型趋于多元化[1].为了能高效地检索出用户关注的视频,对网络上的海量视频进行分类和识别的技术具有愈加广阔的应用前景.
视频动作识别的流程主要包含特征提取和分类两个步骤,其中特征提取是关键.传统视频动作识别分类方法如基于标签文本的关键字匹配,在应对互联网海量视频数据及视频内容复杂度区分方面表现有待提升,而先获取HOG、Sift、LBP等局部特征描述子或基于原始视频图像帧的整体特征(颜色、边缘检测、Cabor等)的方法,又或是应用WANG M.等[2]将局部特征转换成全局特征描述,最后载入分类器的方法都不可避免手动特征提取的问题.相对于传统的方法,深度学习通过一种深层非线性网络结构[3],使用可训练的过滤器层次结构和特征池化操作,实现复杂函数逼近,能够鲁棒且自动地提取样本的复杂特征,从而能够刻画样本的丰富内在信息,使得更加容易分类或预测.其在机器人交互、人机交互、智能监控、体育视频分析等领域取得成功应用[4-5].
由于卷积神经网络在ImageNet大规模视觉识别挑战赛(ILSVRC)上表现出的卓越性能,文献[6-8]提出了将卷积神经网络(convolutional neural networks,CNN)应用于动作识别任务.然而,因为每个单独的视频帧只构成了视频故事……
登录APP查看全文