基于ResNet和LSTM的图像描述生成效果优化研究
2020-08-04岳毅然李霆锋陈鑫锐李煜
岳毅然 李霆锋 陈鑫锐 李煜



摘要:本文基于残差网络和长短期记忆网络,利用AI Challenger图像中文描述挑战赛的数据集,借助前人的研究基础,对图像描述模型的网络结构及参数进行优化和改进,并加以对比试验,通过恰当的评价指标探究模型网络结构对图像语义信息处理和描述匹配生成效果的影响,为提升标注准确度、流畅度提供参考依据。
关键词:图像描述 深度残差网络 长短期记忆网络
前言
近年来,随着深度學习在CV(Computer Vision,计算机视觉)和NLP(Natural Language Processing,自然语言处理)领域的发展和智能科学技术的突破,深度学习中的卷积神经网络(Convolutional Neural Networks,CNN)成为了人工智能领域的热点话题。其中,深度残差网络(Deep Residual Networks,ResNet)是卷积神经网络模型算法中最典型、最成功的算法之一,它是应用最为广泛的特征提取网络,具有权值共享、稀疏连接、网络结构更类似于生物神经网络等特点。
图像描述——看图说话(Image Caption)任务是结合计算机视觉CV和自然语言处理NLP两个领域的一种比较综合的任务,Image Caption模型的输入是一幅图像,输出是对该幅图像进行描述的一段文字。这项任务要求模型可以识别图片中的物体、理解物体间的关系,并用一句自然语言表达出来。图像描述在搜索引擎优化、自动配字、视障辅助阅读等广泛领域有着较高的应用价值。
AI Challenger图像中文描述挑战赛数据集是目前规模最大、语言使用和场景最为丰富的图片中文描述数据集,涵盖了超过100种复杂生活场景的含有人物的二十万张带有标注处理的图片,其场景复杂度、人物动作复杂度、身体遮挡情况都高于现有的其他数据集;而且,此数据集的语言描述标注更符合中文语言使用习惯。……
