小目标检测技术研究综述
2021-01-11王庆玮李传秀
梁 鸿,王庆玮,张 千,李传秀
中国石油大学(华东)计算机科学与技术学院,山东 青岛266580
计算机视觉起源于20 世纪80 年代的神经网络技术,并在近几年得到迅速发展[1]。计算机视觉主要是代替人眼进行图像的分类[2]、检测[3]以及分割[4],从工程的角度看它可以使基于人类视觉的任务实现自动化。目标检测作为计算机视觉的核心任务之一,主要对图片中所包含的多个不同的物体进行定位并给出其相应的边界框[5-6]。目标检测技术已经广泛应用于人脸检测[7-9]、自动驾驶[10-11]、工业生产[12-13]、航空航天[14-16]等领域。如图1所示,目标检测算法包括传统的目标检测算法和基于深度学习的目标检测算法。

图1 目标检测算法分类
传统的目标检测算法利用大小不同的滑动窗口选择出图像中可能存在目标的候选区域,然后使用手工设计的特征对这些区域进行特征提取,包括尺度不变特征变换(Scale-Invariant Feature Transform,SIFT)[17]、方向梯度直方图(Histogram of Oriented Gradient,HOG)[18]、可变形的组件模型(Deformable Part Model,DPM)[19]、局部二值模式(Local Binary Pattern,LBP)[20]等特征,最后将图像特征送到支持向量机(Support Vector Machine,SVM)[21]或迭代算法(Adaptive Boosting,Adaboost)[22]等分类器中进行分类并输出结果。由于传统的目标检测方法受滑动窗口大小和步长的影响,同时手工很难完美的构造出通用特征,场景不同用到的特征就会不同,存在着像窗口冗余、可迁移性差、时间复杂度高等不可避免的问题[23-24]。
1988 年,LeNet[25]作为第一个真正意义上的卷积神经网络模型被提出,为现代卷积神经网络奠定了基础,但由于当时条件限制,计算机硬件水平无法满足训练卷积神经网络的计算量,相比于传统的目标检测效果并没有飞跃的提升。……
