APP下载

多场景融合的细粒度图像描述生成算法

2021-09-15李欣晔张承强周雄图郭太良张永爱

计算机与现代化 2021年9期
关键词:语义机制模型

李欣晔,张承强,周雄图,郭太良,张永爱

(福州大学物理与信息工程学院, 福建 福州 350108)

0 引 言

图像描述是对图像的语义层面进行分析和理解,生成接近于人类语言的描述,近年来成为计算机视觉领域备受关注的领域之一。在图像描述生成领域中,早期模型主要基于模版和检索的方法,当前主流的方法为基于深度学习的方法[1-2]。基于模版的方法类似于填词,将图片中的视觉元素映射到语义空间后填入到句子模板中,该方法简单易实现但生成的句式结构固定;基于检索的方法,类似于查找图像特征,在数据库中搜索相似的图像特征,并从句子库中获取相似图像的描述,缺点在于难以生成新颖的描述。近年来,随着基于深度学习的物体检测模型在检测精度和速度上不断提升,使得图像描述生成方法有了突破性的进展。Vinyals等人[3]提出了一个端到端的卷积神经网络模型(Neural Image Caption, NIC),该模型联合了卷积神经网络(Convolutional Neural Network, CNN)[4]和循环神经网络(Recurrent Neural Network, RNN),使用长短期记忆网络(Long Short Term Memory, LSTM)[5]作为解码器来生成句子,并直接将图像特征作为输入提供给LSTM,在图像描述领域取得了巨大的突破。Mao等人[6]提出了一种多模态递归神经网络(M-RNN),首次将图像描述任务分割成2个分支,使用卷积神经网络提取图像特征,循环神经网络进行文本嵌入,并将得到的特征输入到多模态层中预测句子。Xu等人[7]进一步介绍了一种基于注意力的模型,使模型在生成相应单词时重点关注对应的区域。

目前,主流的基于深度学习的图像描述生成算法,相较于早期的方法已有了较大的改进,但仍存在一些局限性。……

登录APP查看全文

猜你喜欢

语义机制模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
语言与语义
自制力是一种很好的筛选机制
3D打印中的模型分割与打包
“上”与“下”语义的不对称性及其认知阐释
破除旧机制要分步推进
认知范畴模糊与语义模糊
注重机制的相互配合
打基础 抓机制 显成效