基于文本信息补充的图像描述模型
2021-12-08仪秀龙郑杜磊王志余
山东科技大学学报(自然科学版) 2021年6期
花 嵘,仪秀龙,郑杜磊,王志余
(1.山东科技大学 计算机科学与工程学院,山东 青岛266590;2.山东省青岛市黄岛区第一人民医院,山东 青岛 266555)
自动生成图像的描述是计算机视觉的一项基础任务,其目的是识别图像内突出的目标、理解目标之间的关系,最终以人类可以理解的自然语言对其进行表达。自然语言与机器语言的巨大差异使得图像描述成为一项困难的任务,但其在图像视频检索、协助视障群体感知环境等领域具有广泛的应用价值,吸引了学术界和工业界的广泛兴趣。图像描述任务作为跨学科领域的交叉研究问题,将计算机视觉与自然语言处理联合起来,其目标是自动生成图像的描述,难点在于要使计算机“看到”可见的目标并“理解”不可见的目标关系,难度超过图像分类和目标检测。
机器翻译任务采用编码解码的框架,利用循环神经网络(recurrent neural network,RNN)进行编码及解码,最大化P(S|T),将源语言中的语句T转化为目标语言的语句S。受其启发,图像描述任务考虑到卷积神经网络强大的图像特征提取能力,选择卷积神经网络(convolutional neural network,CNN)作为编码器,RNN作为解码器。长短时记忆(long short term memory,LSTM)[1]因具有良好的解决梯度消失的能力成为解码器的首选。LSTM创造性提出了“门控”思想,依靠记忆单元和遗忘门可以有选择地记忆和遗忘信息,但门控结构对信息的筛选会导致信息的遗失,使LSTM隐藏单元的表达能力不足。LSTM隐藏单元表达能力不足会产生两个问题:一是输入信息缺失,二是预测信息不充分。……
登录APP查看全文
