基于深度图像预旋转的手势估计改进方法
2020-08-04徐正则张文俊
徐正则 张文俊



摘要: 基于深度图像的手势估计比人体姿势估计更加困难, 部分原因在于算法不能很好地识别同一个手势经旋转后的不同外观样式. 提出了一种基于卷积神经网络(Convolutional Neural Network, CNN) 推测预旋转角度的手势姿态估计改进方法: 先利用自动算法标注的最佳旋转角度来训练CNN; 在手势识别之前,用训练好的CNN 模型回归计算出应预旋转的角度, 然后再对手部深度图像进行旋转; 最后采用随机决策森林(Random Decision Forest, RDF) 方法对手部像素进行分类, 聚类产生出手部关节位置. 实验证明该方法可以减少预测的手部关节位置与准确位置之间的误差, 手势姿态估计的正确率平均上升了约4.69%.
关键词: 手势估计; 图像旋转; 深度图像
中图分类号: TP391 文献标志码: A DOI: 10.3969/j.issn.1000-5641.201921004
0 引言
随着科技的进步和人类文明程度的提高, 新形式的数字媒体交互设备不断出现. 便携式且可穿戴的虚拟现实(Virtual Reality, VR) 和增强现实(Augmented Reality, AR) 设备要求对传统的交互手段进行变革, 因此手部姿态估计[1] 和手势识别技术[2-3] 的研究与应用激发了广大研究人员的兴趣. 研究人员开发了基于光学的手势识别技术[4], 但是应用环境、光线、肤色、背景复杂度和手势运动快慢的变化对识别结果的影响非常大, 甚至会对手势区域与背景的分离造成巨大干扰.
为了在很大程度上克服以上缺陷, 基于深度图像(Depth Image) 的识别技术应运而生, 并逐渐成为目前主流的手势姿态估计方法[5-8]. 捕捉深度图像的设备称为深度相机, 或称为RGB-D 摄像机, 深度相……