中文图像描述的自动生成与模型分析
2018-04-03北京市延庆区第一中学
电子世界 2018年5期
北京市延庆区第一中学 曹 斌
1.概述
自动图像描述功能从表面上来看,机器不仅要识别出图像中包括哪些物体,同时还必须能够理解并描述物体之间的联系以及它们各自的基本属性和参与的活动,这属于机器高级智能形态的表现了。
从具体实现机制上来看,自动图像描述从信息输入到输出经历了信息的编码和解码两个部分,在机器翻译中,信息编码把输入图像变成特征数据,解码部分再将特征数据转换成目标语言。所以图像描述结合了智能系统两个领域的发展成果:“看”和“语言表达”,分别对应人工智能最重要的两个领域: 机器视觉和自然语言处理。
图像描述的任务是通过一定的训练,让机器自动生成一句话S,来描述给定的二维图像I。句子中的第t个单词记为,其中N是句子的长度。是一个特殊的单词,表示句子结束。注意句子是变长的。单词来自于事先给定的词典,对词典中的单词进行编码后,可以用一个P维向量表示单词。一种常用的编码方式是one-hot编码,它的编码的长度P等于词典中的单词个数,如果单词只有第p个元素为,其余元素全为,那么就可以表示词典中的第p个单词。但是one-hot编码的效率比较低。而且,在使用one-hot编码的情况下,所有的单词都是独立的,距离也是固定的。而在实际情况中,一些意义比较相近的字词,它们在空间的表示应该比较接近。因此可以进一步对单词进行word embedding处理。Embedding编码把单词映射为空间中的实向量,可以更好地表示单词之间的相似性。……
登录APP查看全文
