基于3D CNN的道路视频交通状态自动识别
2021-02-01张媛媛蔡晓禹孟繁和
彭 博 ,唐 聚 ,张媛媛 ,蔡晓禹 ,孟繁和
(1. 重庆交通大学山地城市交通系统与安全重庆市重点实验室,重庆 400074;2. 重庆交通大学交通运输学院,重庆 400074;3. 安徽科力信息产业有限责任公司,安徽 合肥 230088)
为了准确有效地获取交通信息,许多城市在道路设施中布设了感应线圈、视频检测器、RFID (radio frequency identification)卡口等设备. 其中,视频检测器具有直观可视化、信息量大、不影响道路交通等优势,在交通监管中广泛应用,成为交通研究的重要手段.
近年来,人们基于视频数据主要展开了车辆检测、交通参数检测、交通状态识别[1-3]等方面研究,这些方法大多以单帧图像为输入,而很少直接基于视频展开研究. 例如,Wei等[1]基于图像纹理分析技术构建了城市道路交通拥堵快速检测算法,Shi等[2]基于感知特征和随机森林分类器构建了视频图像交通状态估计模型,崔华等[3]利用 FCM (fuzzy C-means)对静态图像进行交通状态识别. 这可能导致帧间运动信息缺失,因此,有必要考虑多帧图像运动特性,据此判断一段视频反映的交通状态. 不过,这需要解决复杂的多帧图像时空信息提取与建模问题.
直到 2013年,基于二维卷积神经网络 (如LeNet[4]、AlexNet、GoogleNet、VGG16[5])在大规模图像解析与分类方面的卓越表现,Ji等[6]拓展出了一种三维卷积神经网络(3D convolution neural network,3D CNN),可对视频作卷积运算,自此,3D CNN视频处理获得了广泛关注:Tran等[7]构建了在所有层使用 3 × 3 × 3 卷积核的视频处理 C3D (convolutional 3D)模型;Xu等[8]以C3D为基础提出了针对连续未修剪视频流行为检测的区域卷积3D CNN模型R3D(region convolutional 3D network);Tran 等[9]进一步把三维时空卷积……
