基于深度可分离卷积和Transformer的关键点检测方法
2023-10-21常方园于文年
常方园,于文年
(1.武汉邮电科学研究院,湖北武汉 430074;2.南京烽火天地通信科技有限公司,江苏 南京 210019)
人体姿态识别技术广泛应用于智慧课堂、医疗健康、人机交互等众多自动化领域,姿态识别技术可以用于实现高质量的人机交互体验,还可以用于实现行为预判功能,通过对当前的行为进行分析,推测目标在下一时间轴的若干行为。
传统的姿态识别方法是基于图模型的方法,通过将身体部位表示为树状结构的图形模型来建模它们的空间相关性,从而预测身体关节的位置。DeepPose[1]模型利用卷积神经网络(Convolutional Neural Network,CNN)来提取目标关节点坐标信息,将2D 人体姿态识别任务中经典的图像处理和模板匹配问题转化为使用卷积神经网络进行图像特征提取和关键点坐标回归的问题。随后,出现了基于热图[2]、卷积姿态机(Convolutional Pose Machines,CPM)[3]以及AlpahPose[4]等一系列深度学习方法来处理人体姿态识别问题。
1 网络构建
1.1 MobileNet结构
传统的神经网络,如VGG[5]、ResNet[6]等的参数主要集中于卷积层,在卷积阶段浪费了大量的资源,不利于在移动端集成。MobileNet[7]网络将传统的卷积用深度可分离卷积代替,大幅降低网络卷积层的参数量和计算量,减少网络复杂度,进而提高运行速度。MobileNet-v1 的网络结构如表1 所示,其中,Conv 表示标准卷积,Conv dw 表示深度可分离卷积,s1 表示步长为1。

表1 MobileNet网络结构
假设输入特征图F 的大小为DF×DF×M,卷积过程中步长和填充为1,其中,DF为特征图的宽度,M为特征图的深度,采用标准卷积经过N个大小为DB×DB×M的卷积核B 后,生成大小为DF×DF×N的特征图G,此过程所需的计算量可以用式(1)表示。……
