基于神经网络的图像描述实现
2021-09-09张大任艾山吾买尔
现代计算机 2021年19期
关键词:模型
张大任,艾山·吾买尔
(1. 新疆大学信息科学与工程学院,乌鲁木齐 830046;2. 新疆大学新疆多语种信息技术实验室,乌鲁木齐 830046)
0 引言
图像描述(Image Caption)任务是一个需要综合计算机视觉和自然语言处理的任务,需要使用计算机建立某种映射方式,让算法根据输入的一幅图自动生成对应的描述性文字。在帮助视觉障碍者理解图像内容,搜索引擎检索,低资源机器翻译上都有较好的应用。
随着深度学习的出现,在海量图像描述数据加持下的深度神经网络自动图像描述系统取得了接近人类描述图像能力的优异成绩。目前世界上的语言约有7000多种,而具有大量图像描述的数据的语种仅有英语,大部分其他的语种相关研究进展较慢,跨语言图像描述效果还不是很明确。随着社会发展的需要,将图像描述技术应用于其他语言上的需求越来越大。
图像描述早期主要是基于模板或语言模型的方法,利用图像处理方法提取出图像的特征,得到图像中可能存在的对象。根据提取出的对象以及它们的属性利用人为制定的规则来形成对图像的描述,由于这种方法需要依赖于事先定义的物体、属性、场景等概念,限制了所产生的描述句子的丰富性。随着深度学习的快速的发展,基于神经网络的图像描述方法有了长足的进步,国内外学者们开始使用神经网络实现图像描述。
本文使用几种不同模型实现图像描述,对比描述效果。并通过构建Flickr8k[1]多语言数据集实现对包括英文、中文、俄文三种语言的图像描述,验证了模型在不同语言上的有效性。……
登录APP查看全文
