APP下载

基于注意力机制的多层次编码和解码的图像描述模型

2021-09-18李康康

计算机应用 2021年9期
关键词:单词特征融合

李康康,张 静

(华东理工大学信息科学与工程学院,上海 200237)

(*通信作者电子邮箱jingzhang@ecust.edu.cn)

0 引言

图像描述任务是图像理解中的重要研究内容,它结合了计算机视觉和自然语言处理两大任务。图像描述需要利用计算机视觉相关的技术准确地识别出图像中的内容,也需要利用自然语言处理中的文本生成的方法生成语法和语义上正确的句子。图像描述任务的关键在于如何充分利用图像特征以及如何有效地解码。

近年来大多数图像描述任务[1-2]都是基于编码器-解码器(Encoder-Decoder)的模型,编码器部分利用VGG(Visual Geometry Group)[3]、ResNet[4]等卷积神经网络(Convolutional Neural Network,CNN)得到图像的特征,然后利用长短期记忆(Long Short-Term Memory,LSTM)网络[5]对特征进行解码从而得到生成的语句。Vinyals 等[1]首先将机器翻译[6]中的编码器-解码器结构引入图像描述任务,他们首先利用预训练的卷积神经网络得到图像特征,并将其输入到LSTM 的第一个时间步骤,然后依次输入上一时间步骤生成的单词,得到描述语句的每个单词。但这种方式仅在第一个时间步骤输入图像特征,使得不是每个时间步骤都关注到图像的重点,而且图像特征信息会随着时间步骤的增加而逐渐减少。注意力机制[7]的使用使得解码器在LSTM 的每个时间步骤都能关注到重要的信息,显著提升了模型的有效性。一些工作[8-10]对编码器部分作出改进,使用 Faster R-CNN(Faster Region-based Convolutional Neural Network)[11]提取对象特征或卷积神经网络的多层次特征;也有一些工作在解码器部分使用了LSTM的变体[9,12],例如双向LSTM(Bidirectional LSTM,Bi-LSTM)[13]、双LSTM 等。然而现有工作缺乏将多层次结构的编码器和解码器有效结合,且现有方法提取特征的方式单一。……

登录APP查看全文

猜你喜欢

单词特征融合
村企党建联建融合共赢
融合菜
从创新出发,与高考数列相遇、融合
《融合》
如何表达“特征”
不忠诚的四个特征
看图填单词
看完这些单词的翻译,整个人都不好了
线性代数的应用特征
单词拾趣