基于多模态神经网络生成图像中文描述①
2020-09-22陈兴
计算机系统应用 2020年9期
陈 兴
(河海大学 计算机与信息学院,南京 211100)
生成图像描述是自然语言处理和计算机视觉的热点研究问题,其任务主要为理解图像中物体和场景等语义信息并采用近似于人类语言的描述形式表达出来,生成符合一定语法规则的文本信息.图片描述作为解决图像信息到文本信息的跨模态转换的重要方法,可广泛应用在人机交互、视觉辅助、图像标注等领域.
Vinyals 等[1]提出了GoogleNIC 模型,借鉴机器翻译中常用的编码解码方式,分别采用InceptionV3[2]预训练模型作为编码器提取图像特征信息,长短时记忆网络(LSTM)[3]作为解码器生成图像描述.Xu 等[4]在解码过程中加入注意力机制,更加关注图像的局部特征.邓珍荣等[5]也应用了注意力机制和卷积神经网络提取图像特征,与Xu 不同的是采用了循环门单元网络(GRU)[6]取代LSTM 网络以此生成图像的描述.
随着生成对抗网络的发展流行,生成对抗机制[7]也逐渐被应用到图像描述生成任务中.例如Dai 等[8]通过控制条件对抗网络[9]中噪音Z 来生成图像的描述,并通过实验证明加入对抗机制生成的描述在该任务上优于其他方法,生成的图像描述在自然性和多样性两方面都有所提高.Shetty 等[10]同样采用生成对抗网络结构,通过对抗机制提高语句多样性.其中生成器利用CNN 提取图像特征,在解码过程引入了目标检测模型,额外的加入RCNN[11]检测图像中具体目标图像,通过加入图像的先验知识来提高生成描述中包含图像目标的概率.文献[12]也通过……
登录APP查看全文
