APP下载

基于深度残差注意力的图像事件描述

2021-04-13张欣怡李永刚季兴隆孙红莲

电脑知识与技术 2021年5期
关键词:深度学习

张欣怡 李永刚 季兴隆 孙红莲

摘要:图像事件描述是根据图像特征数据再结合自然语言处理技术,输出图像事件的语句描述的技术。图像事件的描述,对图片分类、查询等有着极高效率,为了达到更精确的描述效果,本文提出基于深度残差注意力的图像事件描述方法。该方法以ResNet的网络结构为基础,联合分离出的全局注意力与局部注意力,关注图像事件中心事件,生成图像事件描述。在COCO数据集上的实验表明,本文提出的方法能更好关注事件发生区域,对抽象事件描述更为准确。

关键词:图像事件描述;深度学习;注意力机制

Abstract: Image event description is a technology that outputs sentence descriptions of image events based on image feature data combined with natural language processing technology. The description of image events has extremely high efficiency for image classification and query. In order to achieve a more accurate description effect, this paper proposes an image event description method based on deep residual attention. Based on the network structure of ResNet, this method combines the separated global attention and local attention, focuses on the central event of the image event, and generates the image event description. Experiments on the COCO data set show that the method proposed in this paper can better focus on the event occurrence area and describe abstract events more accurately.

Key words: image event description; deep learning; attention mechanism

在過去图像描述研究中,主要采用传统产生式模型,把图像与文本作为输入输出数据,通过寻找底层特征与标签之间的相关性转换成相关语义信息。本文在前人图像描述研究的基础上,将基于产生式模型的深度学习方法应用到图像逻辑语义描述问题上。

Faster-RCNN模型是在CNN模型[1]的基础上,能够更加快速更加高效地获取图像对象的候选区域,速度更快,准确率更高,能有效解决因为网络叠加许多层厚带来的性能快速下降问题[5]。早期的人工语义分析缺点多,耗时、费力、不能成批分析。虽然现有的图像描述模型可以使用神经网络(RNNs)来达到预期的结果,但难以保证我们关心的对象包含在生成的描述中,例如在图像中模糊不明显的对象。一旦在我们关注的对象在训练中被忽略时,问题就会愈发复杂。因此我们采……

登录APP查看全文

猜你喜欢

深度学习
从合坐走向合学:浅议新学习模式的构建
面向大数据远程开放实验平台构建研究
基于自动智能分类器的图书馆乱架图书检测
搭建深度学习的三级阶梯
有体验的学习才是有意义的学习
电子商务中基于深度学习的虚假交易识别研究
利用网络技术促进学生深度学习的几大策略
MOOC与翻转课堂融合的深度学习场域建构
大数据技术在反恐怖主义中的应用展望
深度学习算法应用于岩石图像处理的可行性研究