基于深度学习的人—物交互关系检测综述
2022-09-20廖越李智敏刘偲
中国图象图形学报 2022年9期
廖越,李智敏,刘偲*
1. 北京航空航天大学人工智能研究院,北京 100191; 2.华中科技大学人工智能与自动化学院,武汉 430074
0 引 言
人—物交互关系检测是近年来计算机视觉领域的新兴研究方向,其衍生于经典的目标检测问题,是一个针对时空域人体动作的精细化理解。任务要求检测出图像或视频中产生交互关系的人以及与其产生交互关系的物体,同时还要预测二者的动作关系并关联起来。换言之,输入图像或视频,要求算法模型在空域中输出一系列交互关系三元组〈人的检测框,物体的检测框及类别,关系类别〉,在时空域中额外输出交互关系的起止时间。该任务可以看做一种更高层次的视觉内容理解,不局限于对视觉场景中单个物体的理解,还要求理解物体之间的联系。与传统的关系检测不同,其仅关注以人为中心的动作关系,通过此来理解和分析人的行为,以及与物体之间的交互,而传统的关系检测更关注于广泛的空间位置关系,通过建模目标之间的关系来构建场景图,进行结构化理解。近些年,人—物交互检测已经形成一个独立且热门的研究方向,更有赶超传统关系检测的研究热度。此外,人—物交互关系检测有更广泛的应用场景,其研究成果广泛应用于视频监控、智能车舱、人机交互和智能机器人等多种应用场景,亦可以支撑更高层级的视觉内容理解任务,如视觉稳定、图像描述等。特别是在视频监控中的非机动车以及机动车危险驾驶行为检测领域,人—物交互关系检测成为主要解决方案。……
登录APP查看全文
