基于深度学习的多模态时空动作识别①
2021-03-19吴敏,王敏
计算机系统应用 2021年3期
吴 敏,王 敏
(河海大学 计算机与信息学院,南京 211100)
1 引言
由于互联网的快速发展,传播媒介的日渐丰富,网络视频的数量以指数级的速度大量增长.如何理解视频内容成为一个亟需解决的问题.动作识别作为计算机视觉中的一个热门领域受到了广泛的关注,在监控分析、人机交互、体育视频解读等领域内有着广阔的应用前景.
在动作识别中,有两个关键的有效信息:空间信息和运动信息.一个识别系统的性能在很大程度上取决于它能否从中提取和利用相关信息.然而,由于许多复杂的因素,例如比例变化、视角变化和相机运动等,提取这些信息是非常困难的.因此,设计有效的特征表示和模型方法来处理这些挑战,同时保留动作的有效分类信息就变的至关重要.随着深度学习在图像、文本等领域内取得了成功后,该方法在动作识别领域内也得到了广泛的应用,由早期的手工特征的方法,转变为基于深度学习的方法.卷积神经网络有着强大的建模能力,近年来,机器设备计算能力的提升和大型数据集的出现,使得基于深度学习的方法成为视频分析动作识别的参考标准.
动作识别作为动作预测领域和人体姿态分析的基础,其主要目标就是对视频中的人物所做的行为动作进行理解分类,那么如何有效利用视频中的各部分有效信息进行识别是首要问题.视频识别和图像识别中最大的区分点就是时序信息的使用……
登录APP查看全文
