图像特征注意力与自适应注意力融合的图像内容中文描述
2021-09-18孔东一
计算机应用 2021年9期
赵 宏,孔东一
(兰州理工大学计算机与通信学院,兰州 730050)
(*通信作者电子邮箱kdongyi@163.com)
0 引言
图像内容描述主要工作是通过计算机视觉(Computer Vision,CV)识别图像内的实体、实体属性及实体间的关系,然后利用自然语言处理(Natural Language Processing,NLP)技术生成一段合理的描述语句。图像内容描述属于多模态任务的一种,通过计算机视觉与自然语言处理技术的交叉融合,从而实现图像到文本描述之间的跨模态转换[1]。当前国内外的图像内容描述研究工作,根据技术类型主要分为三类:基于模板的方法、基于检索的方法和基于深度学习的编解码方法。
计算机视觉与自然语言处理领域借助于深度学习的快速发展,使得图像特征提取和语句生成效果大大提升,基于深度学习的编解码方法进行图像内容描述,其效果已经远远超过前两种图像内容描述方法,因此本文使用基于深度学习的编解码方法进行图像内容描述研究。
图像由实体、实体的属性以及实体间的关系组成,例如图1 中有一个男人正在骑一匹棕色的马,“男人”和“马”是实体,“棕色”是“马”的属性,“骑”就是“男人”和“马”之间的关系,实体间的关系等这类信息隐含在图像结构中,不易被网络模型检测和识别。Jiang等[2]研究表明人类在处理隐含信息时可以吸引并引导注意力。Bahrami 等[3]研究表明人类的注意力可以调节隐含信息所引发的大脑活动。因此,人类在对图像进行描述时,在重点关注图像实体对象的同时也会合理地关注实体间的关系等类似的隐含信息。……
登录APP查看全文
