基于可变形卷积的改进YOLO 目标检测算法
2021-10-15黄凤琪冯国富
黄凤琪,陈 明,冯国富
(上海海洋大学 信息学院,上海 201306)
0 概述
目标检测需判断图像中目标的类别及不同目标的边界框位置,是计算机视觉里的主要任务,被广泛应用于视频监控[1-2]、行人检测[3-4]等领域。传统的目标检测方法依赖人工选择的特征进行计算,如HOG[5]、SIFT[6]、Haar[7]等,但计算复杂,运算速度慢,且对目标形变和背景复杂变化的图像检测鲁棒性较差。而深度神经网络依赖其强大的特征提取和特征表示功能,被广泛应用于目标检测任务。
目前主流的目标检测算法有以YOLO[8-10]系列算法、SSD[11-12]系列算法为代表的单阶段算法和以R-CNN[13-14]系列算法为代表的两阶段算法。单阶段算法将目标检测过程看作回归问题来处理,使用一个统一的深度神经网络进行特征提取和目标分类及边界框回归,实现了端到端的推理,具有较快的检测速度,但检测精度没有两阶段算法高;而两阶段目标检测算法先使用区域建议网络(Region Proposal Network,RPN)提取出感兴趣区域,即含有目标的区域,再用深度神经网络对感兴趣区域进行分类及边界框回归,具有更高的检测精度,但其检测速度太慢,达不到实时的要求。
目前对目标检测算法的改进方法主要包括:使用更复杂更深层的骨干网络,以提取更有效的特征;融合多尺度特征,使浅层特征传递到深层,从而提高定位精度;加入新型网络模块,以增强网络的特征提取能力等。FU 等[12]提出在SSD 检测框架的基础上,采用更深的ResNet-101 网络来进行特征提取,并且采用了反卷积层,引入额外的大量语义信息,改进了SSD算法对于小物体的检测能力,但使用更深的基础网络和反卷积层,增加了大量的计算,使得检测速度大幅降低,无法满足实时的要求。……
