基于VGG16和BiLSTM的视频摘要生成
2021-08-03王明江贾娟娟
中国安全防范技术与应用 2021年3期
关键词:模型
■文/王明江 贾娟娟
1.西北师范大学附属中学 2.甘肃政法大学

1 引言
随着信息技术的发展进步,视频数据已迅速成为常见的视觉信息来源。据统计,2020年,中国网络视频用户规模已达到8亿,并且增长趋势逐年递增。如何高效浏览、管理和检索庞大的视频数据已成为当下的热点问题之一。
视频摘要是一种前景广阔的技术,能够很好地应对海量数据的挑战。视频摘要的目的是产生一个能够包含关键信息且内容紧凑连贯的压缩视频,让用户可以在最短的时间内了解到视频的主要内容。
根据现有视频摘要生成方式,视频摘要生成主要分为静态视频摘要和动态视频摘要。静态摘要以关键帧为基础,通过选取若干关键帧,将关键帧融合形成摘要视频;动态摘要则侧重于生成连贯视频,因此动态摘要需要对视频进行镜头划分,然后选取关键镜头,最后将镜头组合成摘要视频。
2 相关工作
2.1 卷积神经网络
VGG网络是由牛津大学视觉几何组在2014年提出的网络模型(Simonyan K 等,2014)。VGG的特点之一是简洁性,例如常用的VGG16包含13个卷积层和3个全连接层以及5个池化层,其中卷积层采用相同的卷积核参数,由3*3的卷积滤波器构成卷积核,设定步长为1,这样的设计能够让每个卷积层卷积之后的结果与该卷积层的输入保持相同的尺寸。池化层参数均为2,这使得每次池化后特征图的长与宽均为前一次的一半。VGG16网络模型主要将卷积层和池化层相互堆叠,加上全连接层组成的分类器构成,VGG16的网络结构如图1所示。……
登录APP查看全文
