基于改进SPPnet的YOLOv4目标检测
2021-12-17杨海舟李丹
杨海舟,李丹
(四川大学锦城学院,四川成都,611371)
0 引言
随着时代的快速发展,目标检测的应用在现代生活中占据了较大比重。如何快速而准确的实现目标检测也成为了一个现阶段的实际问题。现阶段,基于深度学习的目标检测算法可分为两类:Two-stage[1-3]和 One-stage。
第一类是,以R-CNN[1]系列为代表的Tow-stage检测算法,该类算法将检测过程分成两个阶段,先利用边界搜索生成预选框,再利用卷积神经网络实现分类和回归。该类算法虽然增强了精度,但其检测速度较低。第二类是,以YOLO为代表的One-stage检测算法,该类算法通过使用回归模型,将目标定位和分类一体化处理,可以直接获得结果,该类算法的最大特点是拥有较高的速度,而精度相对较低。在精度和速度之间获得更好的平衡,成为衡量目标检测模型综合性能重要的标准。YOLOv4(You Only Look Once)作为YOLO系列网络的最先进的工作,YOLOv4 网络的检测准确率 以及运行速度都远远高于 YOLOv3 网络。其结合了众多目测检测的tricks,完美实现了检测精度和速度的平衡。

表 1 tricks使用及结果对比
YOLOv4的网络结构有四个重要部分组成,分别是:输入(Input)、主干(Backbone)、颈部(Neck)和头部(Head)。输入(Input):主要包括Mosaic数据增强、cmBN、自对抗训练(SAT)。Mosaic数据增强采用4张图片随机处理的方式进行拼接,这增强了对目标的检测,并且由于目标减少,所以也降低了训练成本。自对抗训练(STA)作为一种新型的数据增强方式可以改善学习的决策边界中的薄弱环节,提高模型的鲁棒性。主干(Backbone):采用的CSPDarkNet53作为主干网络,代替了之前的DarkNet53。增强了模型的学习能力的同时也解决了梯度消失问题。……
