基于R-FCN的教室内人物识别
2021-10-25刘寅
刘寅
(广西电力职业技术学院,广西 南宁 530007)
1 概述
近年来,摄像头应用的场景越来越多,基于深度学习技术,通过识别图像中的目标以实现特定功能应用的场景已不少见[1]。而基于学校教室内监控视频图像,运用深度学习技术对人物目标识别的应用场景尚不普遍。通过教室内图像的人物识别,进一步结合数据统计得到教室内人数,可为教育管理和资源调配提供数据参考。目前,基于深度学习技术进行目标检测的方法主要有基于直接回归的One-stage 和基于候选框和分类的Two-stage 两类[2]。One-stage 即直接回归的方法,不使用RPN 网络,被识别目标的类别和坐标通过主网络直接给出。SSD、FSSD架构[3]和常用的YOLO 系列网络[4]都属One-stage。而Two-stage方法是先算出目标的候选框,再用卷积神经网络确定样本的类别。Two-stage的训练过程也分成两步,首先训练RPN 网络[5],再训练目标检测网络。Fast R-CNN、Faster R-CNN、R-FCN 架构[6]都属于Two-stage 方法。基于直接回归的识别方法识别速度快,精度略低,而基于候选框和分类的方法识别精度高,识别速度相对较慢。在上述两类目标检测方法中,R-FCN 架构能够在具备较高检测准确度的情况下,同时具备较快的检测速度[7]。因此,本文基于R-FCN 目标识别架构,结合教室内人物目标场景的特点,实现教室内的人物识别。
2 R-FCN 目标检测架构
R-FCN 目标检测架构是代季峰在2016 年对Faster R-CNN架构进行改进而提出的[8]。R-FCN 目标检测网络架构如图1 所示。从图1 可以看出,R-FCN 网络架构主要可以分为4 个子网络,即卷积神经网络ResNet、区域候选网络RPN、分类网络和回归网络。……
