基于先验MASK注意力机制的视频问答方案
2021-02-05许振雷董洪伟
计算机工程 2021年2期
许振雷,董洪伟
(江南大学物联网工程学院,江苏无锡 214000)
0 概述
随着通信技术水平的提高,视频成为目前最大的信息载体之一。“一图胜千言”生动形象地说明了图像在充当信息介质时的重要性,而视频携带的信息量更多,因此,如何使计算机理解视频中的内容成为学者们的研究热点。图像问答(Visual Question Answering,Visual QA)[1]任务为视频理解的父任务,其简单描述为给定一张图像和一个与图像内容相关的问题,计算机在理解图像内容和问题的基础上给出问题的答案。图像问答的子任务包括图像模式识别和自然语言处理。相对于图像问答,视频问答(Video Question Answering,Video QA)更具挑战性。
目前,视频问答研究发展较缓慢,其中一个重要原因就是数据集的整理(包括收集和标注)成本较高,且与视频相关的处理技术也不够成熟。视频采集过程中不能很好地截取核心内容片段的后果是,一方面若视频时间过长,将导致无关信息增多,难以吸引足够多的人来回答并标注问题,另一方面若时间过短将导致信息不足,造成回答者理解错误。
本文在现有注意力机制框架的基础上,提出先验MASK注意力机制模型。提取视频的关键帧并采用向上注意力机制Faster R-CNN模型获得关键帧的特征以及关键帧中的对象标签,将特征以及对象标签与问题文本分别进行3种注意力加权,采用先验MASK屏蔽无关答案,从而提高视频问答的准确率。
1 相关工作
目前,学术界和工业界对视频问答的研究较少,但有关其父任务,即图像问答[1]的研究非常多,且获得了较大进展。……
登录APP查看全文
