APP下载

基于文本层级结构的图像描述生成算法

2021-08-24靳华中

湖北工业大学学报 2021年4期
关键词:语义特征文本

吴 禹, 靳华中

(湖北工业大学计算机学院, 湖北 武汉 430068)

图像描述生成是一个融合计算机视觉、自然语言处理和机器学习的综合问题。图像描述生成方法使用符合人类语言习惯的句子描述图像。算法模型在检测图像中的目标的同时,还要对目标的视觉元素,如目标的动作和属性有一定的认知。在此基础上,通过理解目标之间的相互关系,构建图像的场景,目的是生成具有语义关系的、符合自然语言习惯的描述句子。

目前图像描述生成模型普遍采用编码器-解码器框架。编码器利用卷积神经网络(CNN)从图像中提取图像特征[1],解码器使用循环神经网络作为语言模型来预测文本,引入注意力机制,有效地选择视觉特征向量来初始化语言模型隐藏状态[2],提高视觉信息处理效率,在客观指标上展现出明显优势。但在语言模型的构建上存在不足,使得语义信息不能充分表达。文献[3]将图像特征向量与每个单词的嵌入连接起来,以便为以后生成的单词保留视觉信息,但难以解决RNN梯度消散问题。文献[4]提出通过与自动重构网络(ARnet)耦合来增加相邻隐藏状态之间的相关性。并嵌入上一隐藏层状态解码更多语义特征信息,然而使用欧几里得距离的正则化方法可能会直接减少每个隐藏状态的L2范数,使得评价指标没有获得较大改善。文献[5]在自下而上和自上而下的组合注意力机制的基础上融入图文匹配模型 (Stacked Cross Attention Network,SCAN)[6]对注意力机制的训练过程进行弱监督,增强了注意力机制对单词和图像区域的对应能力,但难以表征图像目标之间语义关系。……

登录APP查看全文

猜你喜欢

语义特征文本
语言与语义
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
基于doc2vec和TF-IDF的相似文本识别
“上”与“下”语义的不对称性及其认知阐释
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
认知范畴模糊与语义模糊
如何快速走进文本
线性代数的应用特征