基于关键点检测二阶段目标检测方法研究
2021-10-13王宏任陈世峰
王宏任 陈世峰
1(中国科学院深圳先进技术研究院 深圳 518055)
2(中国科学院大学深圳先进技术学院 深圳 518055)
1 引 言
目标检测是计算机视觉中很常见的任务。根据有无提取候选区域(Region Proposal),目标检测领域的检测方法通常分为一阶段(One-stage)检测网络和二阶段(Two-stage)检测网络。其中,一阶段检测方法直接回归物体的类别概率和位置坐标值。常见的一阶段算法包括:YOLOv1[1]、YOLOv2[2]、YOLOv3[3]、SSD[4]、DSSD[5]和Retina-Net[6]。二阶段检测方法的任务包括第一阶段提取候选区域以及第二阶段将候选区域送到分类器进行分类与检测。常见的二阶段算法包括:R-CNN[7]、SPP-Net[8]、Fast R-CNN[9]、Faster R-CNN[10]、Mask R-CNN[11]和 Cascade R-CNN[12]。与一阶段检测网络相比,二阶段检测网络的检测精度更高,但速度慢于一阶段检测网络。
另外,根据是否利用锚框(Anchor)提取候选目标框,目标检测框架也可分为基于锚框的方法(Anchor-based)、基于无锚框的方法(Anchorfree)以及两者融合类。其中,基于锚框类算法有Fast R-CNN、SSD、YOLOv2 和 YOLOv3;基于无锚框类算法有 CornerNet[13]、ExtremeNet[14]、CenterNet[15]和 FCOS[16];融合基于锚框和基于无锚框分支的方法有 FSAF[17]、GA-RPN[18]和SFace[19]。
目前,所有的主流探测器,如 Faster R-CNN、SSD、YOLOv2 和 YOLOv3 都依赖一组预先定义的锚框。其中,人们认为锚框的使用是检测器成功的关键。尽管这些主流探测器取得了巨大的成功,但基于锚框方法仍存在一些缺点:(1)即使经过仔细的设计,但由于锚框的尺度和长宽比是预先设定的,检测器在处理形状变化较大的候选物体时也会遇到困难,尤其是对于小物体,这无疑阻碍了检测器的泛化能力;(2)为了达到较高的召回率,需要在输入图像上密集放置锚框(如对于短边为 800 的图像,在特征金字塔网络(FPN)中放置超过 180k 的锚框),但大多数锚框在训练中被标记为负样本,而过多的负样本会加剧训练中正负样本之间的不平衡;……
