热图引导连接的人体姿态估计方法
2021-11-16王仓龙刘沫萌
王 伟,王仓龙,裴 哲,刘沫萌
(西安工程大学 计算机科学学院,陕西 西安710048)
0 引 言
人体姿态估计旨在根据图像预测每个人的关键点位置。实际应用十分广泛,包括动作识别[1]、行人重识别[2]及人机交互[3]等。随着深度学习的发展,卷积神经网络在人体姿态估计领域所表现出的性能远高于其他传统方法,例如概率图模型[4]或图结构模型[5],并且近年来的研究表明,基于热图引导来预测关键点的方法[6-8],预测的精度远优于直接对关键点位置的预测[9-10],而获得关键点位置后,更重要的是如何将关键点连接为人体姿态数据。
目前人体姿态估计方法主要分为:自上而下(Top-down)和自下而上(Bottom-up)。Top-down首先检测人体,使用前置的目标检测网络标识出画面中人体的边界框(bounding-box,b-box)[11],该方法将多人人体姿态估计问题转化为单人人体姿态估计[12-15]。文献[16-17]提出的HRNet通过多分辨率融合以及保持高分辨率的方法极大的提高了关键点的预测精度。由于Top-down在目标检测阶段就消除了大部分背景,因此很少有背景噪点或者其他人体的关键点,简化了关键点热图估计,但是在人体目标检测阶段会消耗大量的计算成本,并且不是端到端的算法。
与之相反,Bottom-up首先预测图像中所有人体关键点位置,然后将关键点链接为不同的人体实例。代表性工作有:DeepCut方法和DeeperCut方法开创性地将关键点关联问题表示为整数线性规划问题[18-19],可以有效求解,但处理时间长达数小时。而Openpose方法基本可以做到实时检测,其中的PAF组件用来预测人体部件,连接可能属于同一人体的关键点[20],并且PifPaf方法对该方法进一步拓展,提高了连接的准确度[11]。……
