基于高斯层级损失的开放场景物体检测*
2021-07-20王琳陈熙霖
王琳,陈熙霖
(1 中国科学院上海微系统与信息技术研究所, 上海 200050;2 中国科学院计算技术研究所, 北京 100190;3 上海科技大学信息科学与技术学院, 上海 201210) (2020年8月11日收稿; 2021年1月26日收修改稿)
物体检测是计算机视觉中一个重要的前置性任务,是指在图像或视频中给出物体的位置及对应的类别。因此物体检测包括2个子任务:定位物体的位置和识别物体的类别。近年来,物体检测领域取得显著进展,出现了若干具有代表性的物体检测方法[1-4],在若干个基准检测数据集上也取得越来越好的结果。但是对于未出现过的物体,例如使用不包含类别“dog”的训练集训练的物体检测模型,对如图1所示的图片,则无法检测到“dog”这一类别,但却将检测框误判为“horse”、“sheep”或“cat”等这些训练集中出现过并且视觉特征比较相似的类别。这一现象表明,这类方法无法解决开放场景中的物体检测问题。究其原因,在于这些方法受限于训练集中的类别数量(Pascal VOC[5]20类、MS COCO[6]80类),试图以有限训练集应对无限开放世界是不可能的,由此必须另辟蹊径应对开放场景中的物体检测。图1的现象也表明,对定位和识别2个子任务而言,前者具有更好的普适性,迁移相对容易,而识别任务因检测算法设计的原因,相对比较困难。

图1 以往方法使用不包含类别“dog”的训练集训练得到检测器在包含“dog”类上的检测结果Fig.1 Detected results with previous object detection method and trained without “dog”
注意到人类应对开放场景的特点——当识别新的物体类别时,通常人们不仅仅依赖于其表观信息,而且还会借鉴日常生活以及学习过程中获取的先验知识。……
