基于YOLOv5算法的道路场景目标检测应用研究
2021-11-01陈影
陈影
(合肥工业大学数学学院,合肥230009)
0 引言
简单来说,计算机视觉是处理数字可视化数据(或任何可视化数据)的算法、方法和技术。目标检测则是计算机视觉中的一个基本的视觉识别任务,旨在在给定图像中找到具有精确定位的特定目标类的对象[1]。近年来,基于深度学习的目标检测技术一直得到广泛的研究而不断发展。
常用的目标检测模型包括Faster R-CNN[2],SSD[3],YOLO[4-7]等。Faster R-CNN的网络结构可以分成两个部分。一个是用来生成候选区域(Region Proposal)的深层全卷积网络(RPN),另一部分则是Faster R-CNN检测器,其输入是由前一部分RPN网络所生成的候选区域。其中,RPN使用基础网络通过一系列卷积和池化操作来提取图像的特征,获得原始特征图,然后在原始特征图之后连接卷积层和ReLU层,来得到图像候选区域的特征图。特征图的每个点的输出包括k个锚点,是否有目标,以及k个候选区域的坐标值。
上述Faster R-CNN可以看作是经典的“twostage”目标检测器,对小目标检测效果极佳。而SSD方法不同于Faster R-CNN,是一种检测速度很快的“one-stage”方法[3]。与Faster R-CNN类似,SSD也提出了锚点的概念。卷积输出的特征图中的每个点对应于原始图像区域的中心点。然后以该点为中心,可以构造六个具有不同宽高比和不同大小的锚点(即SSD中的默认框)。对于VOC数据集而言,SSD中每个锚点对应于4个位置参数(x,y,w,h)以及21个类别概率(包括20个对象类别概率,以及一个锚点是否是背景的描述)。
YOLO由Joseph Redmon在2016年提出,自此之后YOLO系列不断迭代发展,被广泛应用于有实时性需求的目标检测场景中,例如在无人驾驶、物流分类、军事打击等领域,得到了广泛的认可。……
