基于改进YOLOv3算法的行人检测研究
2021-01-07刘子龙
叶 飞,刘子龙
(上海理工大学 光电信息与计算机工程学院,上海 200093)
目标检测的目的是从不同的视觉信息中识别图像中所要确定对象的大小以及位置情况,并且将其从不同背景图像中分离出来。对于行人的检测是在给定的图像与视频中判断是否有行人。行人检测的算法可分为:基于背景建模、基于轮廓模板、基于底层特征和基于统计分析学习4大类[1]。在行人检测的算法中,比较经典的行人检测方法包括Dalal 等人提出的梯度直方图(Histogram of Oriented Gradient,HOG)以及与线性分类器支持向量机(Support Vector Machine,SVM)结合的行人检测方法,后者在MIT行人数据集上展现出了十分出色的性能[2-3]。Felazenszwalb等人随后提出了一种改进的组件模型(Deformable Part Model,DPM)算法,其对于形变之后的目标对象具有很强的鲁棒性[4-5]。
最近几年,得益于计算机算力提升,深度学习得到了巨大的发展,许多研究者将深度学习和目标检测结合来起来。使用深度神经网络的目标检测与传统的目标检测算法相比具有许多优点。传统的方法使用底层信息,对于行人目标的检测能力不足,且往往依靠人工手动来获取特征。使用深度学习的方法可以通过大量的数据学习相应数据差异的特征。基于神经网络的目标检测可分为两类:一种是基于区域的区域卷积神经网络(Region-Convolutional Neural Networks,R-CNN)系列,例如 Fast R-CNN、Faster R-CNN;另外一种是基于回归的SSD(Single Shot Multi Box Detector)和YOLO(You Only Look Once)系列[6-7]。
从网络结构来看,YOLO和R-CNN网络区别如下:(1)YOLO的训练和检测、特征提取和回归分类都是在一个网络中完成的,是一个单独的端到端的网络;(2)YOLO将对象检测看作一个回归问题,一旦将图像输入网络,就可以获得图像中对象位置以及们的类别和相应的置信概率[8]。……
