基于神经网络方法的图像描述研究综述
2020-04-22刘浩
现代计算机 2020年8期
刘浩
(四川大学计算机学院,成都610065)
0 引言
视觉理解一直是计算机视觉领域的基础任务,这有助于计算机更好地理解这个多维世界,为将来人工智能全方位服务人类提供可能。其中Image Caption(图像描述)是一个融合计算机视觉和自然语言处理的综合问题,该任务对于人类来说非常容易,但是受限于不同领域的结合,要求机器去理解图片的内容并且还要用自然语言去表达它们之间的关系却非常具有挑战性。这不仅要求机器生成准确的、通顺的人类可读的句子,而且还要求句子的内容能充分表现图像的内容。受益于神经网络技术的发展和大数据的兴起,近些年不断有关于Image Caption 任务的创新方法被提出,其中不乏一些具有开创性意义的方法,为Image Caption 任务的研究与发展做出了巨大的贡献。
1 相关工作
早期关于Image Caption 任务的做法例如由Kulkarni 等人[1]和Farhadi 等人[2]提出的方法都是利用图像处理的一些算子提取出图像的特征,经过SVM(支持向量机)分类等方法得到图像中可能存在的目标。然后根据提取出的目标以及他们的属性利用CRF(条件随机场)或者是一些预先制定的规则来恢复成对图像的描述。这种做法非常依赖于图像特征的提取和生成句子时所需要的规则。自然而然这种效果并不理想。
在Vinyals 等人[3]提出的方法出现之前,利用RNN(循环神经网络)做机器翻译实际上已经取得了非常不错的成果。常用的做法是利用Encoder RNN(编码器RNN)读入源语言文字生成中间隐层变量,然后利用Decoder RNN(解码器RNN)读入中间隐层变量,逐步生成目标语言文字。……
登录APP查看全文
