基于深度学习的视频目标检测综述
2021-09-13王迪聪白晨帅邬开俊
王迪聪,白晨帅,邬开俊+
1.兰州交通大学 电子与信息工程学院,兰州730070
2.天津大学 智能与计算学部,天津300350
Hinton 等人[1]在2015 年提出了通过神经网络对多媒体数据中的高级特征进行自动学习,自此,深度学习在包括分类、分割、检测等计算机视觉(computer vision,CV)任务中得到了广泛的应用。基于深度学习的目标检测也成为了非常热门的研究领域[2-5]。作为计算机视觉中的基础任务,使得场景分析和理解能够顺利进行,而视频中的目标检测则更加贴近真实场景的任务需求,如视频监控、自动驾驶、无人机导航[6-7]等。与静态图像的目标检测不同,由于视频中的目标是不断变化的,而这些变化对检测的效果会产生非常重要的影响,这是解决视频目标检测问题的重点也是难点。
传统的特征判别方法有以下四种:方向梯度直方图(histogram of oriented gradient,HOG)[8]、尺度不变特征变换(scale-invariant feature transform,SIFT)[9]、滑动窗口[8]和局部形变模型(deformable part model,DPM)[10]及其扩展。在目标检测中,因传统的滑动窗口方法会消耗很大的计算资源,后来逐步被候选窗口所代替,而目前较为通用的方法为选择搜索(selective search)[11]和边缘窗口(edge-box)[12],但其速度依然很慢。
在网络方面,随着深度学习的不断发展,神经网络迅速涵盖了计算机视觉的各领域,通过增加网络的层数,使得神经网络的解析能力更强。在数据方面,ImageNet[13]、MS COCO(Microsoft common objects in context)[14]等大型数据集的建立促使网络越深性能越好成为了可能。由于当时算力的限制,只有七层的卷积神经网络AlexNet[15]在2012年的ILSVRC(ImageNet large scale visual recognition challenge)图像分类大赛中以高出第二名十多个百分点的绝对优势摘得桂冠,其性能也在检测、识别等领域得到了广泛验证。……