基于注意力机制的人体关键点隐式建模网络
2024-03-21赵佳圆张玉茹苏晓东徐红岩李世洲张玉荣
计算机工程 2024年3期
赵佳圆,张玉茹,苏晓东,徐红岩,李世洲,张玉荣
(1.哈尔滨商业大学计算机与信息工程学院,黑龙江 哈尔滨 150028;2.黑龙江省电子商务与智能信息处理重点实验室,黑龙江 哈尔滨 150028)
0 引言
近年来,人体姿态估计任务[1]已经成为计算机视觉领域的研究热点,主要应用于人机交互[2]、行为识别[3]等领域。该任务的主要目的是检测并定位图片中所有人体关键点,例如手、膝盖等。目前的研究表明,尽管卷积神经网络在姿态估计任务中表现不错,但对于局部信息比较敏感,要想获取全局上下文信息,就必须依赖更大的卷积核或更深的层。目前,许多单尺度网络都采用经典的编解码器结构,例如文献[4-5]介绍上述网络通过卷积、池化等下采样操作提取特征,并通过上采样操作恢复分辨率。虽然这样的结构已经取得了很好的性能,但对于复杂关键点的识别精度难以提升,主要原因是单尺度网络缺乏输入空间的上下文信息。为了解决这个问题,文献[6-7]提出了多尺度结构,将不同尺度的特征进行融合,以获得共享的特征表达。
虽然多尺度结构已经取得了不错的效果,但是它在实际任务中仍然会受到人体可变性和外部因素的影响。此外,复杂的关键点(如“膝”和“脚踝”)很难被精确识别。在MPII 数据集中,高分辨率网络(HRNet)对简单的关键点(如“头”和“肩”)的PCKh@0.5 精度已经接近饱和,分别为96.2%和95.0%。然而,对于复杂的关键点,例如“膝”和“脚踝”,PCKh@0.5 精度仅达到84.3% 和80.6%,这限制了模型的整体性能。虽然高分辨……
登录APP查看全文
