基于IndRNN 与BN 的深层图像描述模型
2021-10-15曹渝昆魏健强
计算机工程 2021年10期
曹渝昆,魏健强,孙 涛,徐 越
(上海电力大学计算机科学与技术学院,上海 201306)
0 概述
图像描述是指通过分析输入图像来生成恰当的关于图像内容的文字描述[1],可应用于图像检索、机器人问答、儿童辅助教育、导盲等多个领域,对图像描述进行研究具有重要的现实意义[2]。
目前,主流图像描述框架以基于深度卷积神经网络(Convolutional Neural Network,CNN)[3]和循环神经网络(Recurrent Neural Network,RNN)[4]为主。RNN 一般由LSTM(Long-Short Term Memory)单元构成,由于其使用sigmoid 等饱和激活函数,使得网络在训练过程中收敛较慢,并存在层间梯度消失等问题,导致无法使用LSTM 单元构建一个深层网络模型。因此,由上述单元构成的模型性能有限,生成的描述语句缺乏丰富性与连贯性,需要构建一个深层次的解码端网络,使用正确的模型训练和优化方法,使得语言生成模型具有更好的拟合能力与训练效果。
本文提出一种深度图像描述模型Deep-NIC。在Deep-NIC 中,编码端由inception V3[5]提取图像特征,解码端由7 层解码单元构成,每个解码单元包含IndRNN 层[6]和BN 层[7]。通过IndRNN 来有效避免层间梯度消失问题,利用BN 方法提升训练效率同时避免过拟合问题,在此基础上,构建深层解码端来提升模型的拟合效果。
1 相关工作
图像描述是一个综合性任务,涉及计算机视觉与自然语言处理两大方面,近年来受到国内外众多研究人员的关注。图像描述在提出初期,主要依靠固定模板:首先利用有效的算子提取图像特征;然后通过机器学习中的分类算法进行分类,从而得到图像中可能存在的目标;……
登录APP查看全文
