基于深度学习的视频检索方法研究*
2021-10-09薛继伟刘济尘刘显德
薛继伟 刘济尘 刘显德 李 冰
(1.东北石油大学计算机与信息技术学院 大庆 163318)(2.吉林大学软件学院 长春 132200)
1 引言
随着互联网的飞速发展,视频数据每天以惊人的速度在增加,通过人工方式在大量的视频中检索到特定人变得越来越困难和不切实际。由于多种原因,各类影视公司和数字媒体公司往往面临着对特定视频中的特殊人进行定位和再编辑的需求,而目前绝大多数非线性编辑系统中没有智能检索功能,都是靠人工方式进行,浪费大量人力物力。
机器学习技术推动了现代社会的许多方面:从网络搜索到社交网络的内容过滤,再到电子商务网站的推荐等[1]。传统的机器学习技术因为使用数据的原始形式进行处理而受到限制。深度学习模型由于使用多个处理层来学习原始数据的多级抽象表示,在图像识别[2~3]、语音识别[4~5]、预测潜在药物分子的活性[6]等领域取得了重大进展。
本文提出了一种基于深度卷积网络的视频检索方法,实现了在特定视频中检索特定人的功能,为非线性编辑及相关人员提供视频的快速定位。
2 相关工作
自2012年Krizhevsky等利用一个8层的卷积神经网络AlexNet[2]在当年的ImageNet图像分类竞赛(ILSVRC2012)中以top-5错误率15.3%的绝对优势取得冠军以来,卷积神经网络在大规模图像和视频识别方面取得了巨大的成功。AlexNet中使用了11×11、5×5和3×3卷积核,网络参数较多。2014年Simonyan等全部使用3×3小卷积核设计了深层卷积网络VGG16和VGG19,获得了ILSVRC2014比赛的亚军,使得top-5错误率降低到6.8%[7]。同年Google公司的Szegedy等在网络宽度和深度两方面对AlexNet进行了改进,设计了22层的GoogleNet,获得了ILSVRC2014比赛的冠军[8]。……
