基于对称注意力机制的视觉问答系统①
2021-05-21吴春雷王雷全
计算机系统应用 2021年5期
路 静,吴春雷,王雷全
(中国石油大学(华东)计算机科学与技术学院,青岛 266580)
1 引言
近年来,基于视觉和语言的跨模态任务,如视频场景识别[1]、图文匹配[2]、视觉问答[3]等,在学术界和工业界引起了越来越多研究者的兴趣.其中,视觉问答(Visual Question and Answering,VQA)可以用来测试智能机器对多模态信息的理解和推理能力,故被认为是一种评估当前机器学习模型实现程度的“视觉图灵测试”.因此,VQA 越来越受到重视,它的具体任务是给定一张图片和一个问题,通过两者的合理融合生成相应的答案.VQA 研究的重点在于如何更加全面的理解视觉内容和自然语言,如何更精准地提取和表示模态特征,以及如何更有效地融合跨模态信息.为了挖掘图像突出区域与问题文本中重要词之间的对应信息,在VQA 任务中引入了注意机制.目前主流的算法是将问题信息与图片信息经过注意力机制生成含有双边信息的特征,再将其放到答案预测器中生成结果.但是这种算法只考虑了问题和图像的双边信息,却忽略了图像信息和问题信息自身的关联性.因此,本文提出一种新的模型,该模型通过利用图片和问题的自关联性和共同注意力信息,进一步提升答案和图片的契合度.本文提出的模型在回答问题的准确率上与基线模型相比取得了一定的提升,这进一步说明了该模型的有效性.
本文中,创新点可以总结归纳为如下3 点:
(1)本文在单模态特征中增强了特征区域间的关联性……
登录APP查看全文
