基于层级注意力的故事性图像描述生成的研究
2021-03-10苏静
电子技术与软件工程 2021年20期
苏静
(广东工业大学 广东省广州市 510006)
随着深度学习技术的发展,图像描述的研究引起了许多研究者们的关注。图像描述任务主要由图像特征提取的视觉模型和文本生成的语言模型组成。两个模型之间的有效关联对生成的文本质量起着决定性作用,所以,研究者们的工作目标就是找到图像特征和文本语义之间的有效关联方法。在日常生活中,序列图像描述比单图像描述更具有挑战性,本文的研究就是基于序列图像的故事性文本描述,即输入多张图像信息,生成具有相关联的几句话来描述这几张图像。近几年序列图像描述的研究方法有很多,2016年,Huang[1]等人使用端到端的机制解决故事描述任务,2017年Yu[2]等人通过首先选择一组图像中最具代表性的图像,然后通过这张图片生成故事描述。这些方法都是直接对多个图像进行单图像描述,然后再把描述结果合并在一起,仅考虑了词与词之间的关系,但没有很好的考虑多个句子之间的关系和关注图像细节特征。为了解决以上问题,我们提出了层级注意力模型,第一层使用attention-LSTM解决句子之间的关系,第二层使用attention-LSTM 解决图像和词之间的关联。实验结果表明,我们的方法在BLEU[3]和CIREr[4]评价指标上优于大多数方法,生成的描述句子间关联性强,连贯性好。
1 模型架构
1.1 模型概述
我们的层级注意力模型使用分层处理的思想,逐层解决句间依赖关系和单词间关系,模型架构图如图1所示,从CNN 出来的实线代表一组图像的特征,虚线代表单张图像的特征。……
登录APP查看全文
