APP下载

基于文本信息补充的图像描述模型

2021-12-08仪秀龙郑杜磊王志余

关键词:文本实验信息

花 嵘,仪秀龙,郑杜磊,王志余

(1.山东科技大学 计算机科学与工程学院,山东 青岛266590;2.山东省青岛市黄岛区第一人民医院,山东 青岛 266555)

自动生成图像的描述是计算机视觉的一项基础任务,其目的是识别图像内突出的目标、理解目标之间的关系,最终以人类可以理解的自然语言对其进行表达。自然语言与机器语言的巨大差异使得图像描述成为一项困难的任务,但其在图像视频检索、协助视障群体感知环境等领域具有广泛的应用价值,吸引了学术界和工业界的广泛兴趣。图像描述任务作为跨学科领域的交叉研究问题,将计算机视觉与自然语言处理联合起来,其目标是自动生成图像的描述,难点在于要使计算机“看到”可见的目标并“理解”不可见的目标关系,难度超过图像分类和目标检测。

机器翻译任务采用编码解码的框架,利用循环神经网络(recurrent neural network,RNN)进行编码及解码,最大化P(S|T),将源语言中的语句T转化为目标语言的语句S。受其启发,图像描述任务考虑到卷积神经网络强大的图像特征提取能力,选择卷积神经网络(convolutional neural network,CNN)作为编码器,RNN作为解码器。长短时记忆(long short term memory,LSTM)[1]因具有良好的解决梯度消失的能力成为解码器的首选。LSTM创造性提出了“门控”思想,依靠记忆单元和遗忘门可以有选择地记忆和遗忘信息,但门控结构对信息的筛选会导致信息的遗失,使LSTM隐藏单元的表达能力不足。LSTM隐藏单元表达能力不足会产生两个问题:一是输入信息缺失,二是预测信息不充分。……

登录APP查看全文

猜你喜欢

文本实验信息
记一次有趣的实验
在808DA上文本显示的改善
做个怪怪长实验
基于doc2vec和TF-IDF的相似文本识别
订阅信息
NO与NO2相互转化实验的改进
实践十号上的19项实验
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
展会信息
如何快速走进文本