融合注意力和动态语义指导的图像描述模型*
2017-12-13周治平
张 威,周治平
江南大学 物联网技术应用教育部工程研究中心,江苏 无锡 214122
融合注意力和动态语义指导的图像描述模型*
张 威+,周治平
江南大学 物联网技术应用教育部工程研究中心,江苏 无锡 214122
针对当前图像语义描述生成模型对图像内目标细节部分描述不充分问题,提出了一种结合图像动态语义指导和自适应注意力机制的图像语义描述模型。该模型根据上一时刻信息预测下一时刻单词,采用自适应注意力机制选择下一时刻模型需要处理的图像区域。此外,该模型构建了图像的密集属性信息作为额外的监督信息,使得模型可以联合图像语义信息和注意力信息进行图像内容描述。在Flickr8K和Flickr30K图像集中进行了训练和测试,并且使用了不同的评估方法对所提模型进行了验证,实验结果表明所提模型性能有较大的提高,尤其与Guiding-Long Short-Term Memory模型相比,得分提高了4.1、1.8、2.4、0.8、3.1,提升幅度达到6.3%、4.0%、7.9%、3.9%、17.3%;与Soft-Attention相比,得分分别提高了1.9、2.4、3.3、1.5、2.74,提升幅度达到2.8%、5.5%、11.1%、7.5%、14.8%。
图像标注生成;图像内容描述;深度神经网络;视觉注意力;语义信息
1 引言
随着深度神经网络的兴起,图像描述生成开始引起研究人员的兴趣。图像描述生成是指使机器自动描述图像的内容。机器自动描述图像内容有着广泛的应用,尤其是在图像检索[1]和视力缺陷人群的辅助方面有着很好的应用前景。图像描述生成还处于研究的初级阶段,有许多问题亟待解决[2-6]。
Mao等人[5]提出的多模循环神经网络(multimodal recurrent neural networks,m-RNN)模型使用深度卷积神经网络读取整体图像信息,然后分别在每一步中输入到多模循环神经网络中以预测下一步产生的描述单词。……