面向深度学习的视觉问答技术的分析
2021-01-06王青青郭星晨
阜阳师范大学学报(自然科学版) 2020年4期
王青青,郭星晨,王 亚
(阜阳师范大学 计算机与信息工程学院,安徽 阜阳 236037)
近年来,随着深度学习和计算机视觉的结合与发展,计算机视觉已在相关领域得到了广泛应用,如:目标检测、图像分类、动作识别等。这些领域大多不需要充分理解图像所包含的语义信息,而随着应用研究的不断深入,人们提出在计算机视觉领域中引入交互式问答的方法对视觉对象进行交互式内容理解,由此,视觉问答(visual question answer,VQA)应运而生。视觉问答技术涵盖了计算机视觉和自然语言处理两个领域,它需要建立模型去分析图像并理解问题,即在输入一张图像及与图像相关的问题,模型能自动输出一个预测答案[1-4]。视觉问答可以被视为是一个知识综合体,它在实践中有着非常广泛的前景,比如盲人的视觉助理可以根据盲人拍摄的前方图像回答盲人所提的问题,为盲人做出正确的导向判断[5],另外在幼儿在线教育和自动查询监控视频等方面也有广阔的应用。因此,视觉问答是一个非常值得深入研究的领域。为了更好地理解视觉问答技术,本文主要分析了视觉问答模型和常见的公开数据集,并对视觉问答进行了总结和展望。
1 视觉问答技术
VQA是近年来人工智能领域出现的一个新兴话题,自动回答有关视觉内容的问题被认为是人工智能的最高目标之一。其独特之处在于它跨计算机视觉和自然语言处理领域处理问题,难点和目标在于构建一个设计合理的模型,预测正确的答案,该技术的基本模型框架如图1。……
登录APP查看全文
