跨模态检索中的相似性漂移问题*
2021-10-10郑奇斌刁兴春王彦臻曹建军
国防科技大学学报 2021年5期
郑奇斌,刁兴春,王彦臻,曹建军,刘 艺,秦 伟
(1. 陆军工程大学 指挥控制工程学院, 江苏 南京 210007; 2. 军事科学院, 北京 100089;3. 军事科学院 国防科技创新研究院, 北京 100071; 4. 天津(滨海)人工智能创新中心, 天津 300450;5. 国防科技大学 第六十三研究所, 江苏 南京 210007)
随着多媒体、互联网和大数据等技术的迅速发展,文本、图像等不同模态的数据迅速涌现[1]。不同模态的数据结合在一起,显示出较单模态数据更加丰富的自然和社会属性[2]。而近年来机器学习等技术的发展使得综合利用多模态数据成为可能,特别是得益于深度学习技术的发展,跨模态检索[3]、视觉问答[4]、跨模态推理[5]等多模态应用取得了巨大的进步。
跨模态检索旨在发现不同模态(除少数工作,如文献[6]涉及两种以上模态的数据,大部分研究都聚焦于文本和图像两种模态)数据对象间的相似关系,例如通过文本描述检索具有相似语义的图像,或通过图像检索具有相似语义的文本[7]。由于不同模态数据的表征是异构的,其相似度难以直接计算,通常需要将文本、图像等数据映射到目标表示空间或一个公共表示空间中[2-3]。现有研究通过典型相关分析[7-11]、主题模型[12-14]、稀疏表示[15-16]等方法实现跨模态映射,而近年来基于深度学习的方法[6, 17-22]由于其优异的性能成了主流。
尽管以上方法各不相同,但其中采用的映射函数形式几乎是线性变换或深度神经网络,并通过相应的损失函数学习其具体参数。其中,最常见的损失函数是最大边界损失[17, 23],此外还有对抗型损失[24]、最大似然估计损失[25]等。……
登录APP查看全文
