基于K⁃means 的深度跨模态哈希量化优化方法
2021-11-10吴家皋翁玮薇刘林峰
吴家皋,杨 璐,翁玮薇,刘林峰
(1.南京邮电大学计算机学院,南京 210023;2.江苏省大数据安全与智能处理重点实验室,南京 210023)
互联网应用的普及使得文本、图像和视频等多模态数据在网络上快速增加。如何有效地利用各种模态数据进行信息检索已成为相关领域的研究热点,而跨模态检索则是其中的关键技术之一[1‑3]。跨模态检索是指在不同模态的数据中进行检索,即通过一种模态的数据检索出语义相似的其他模态数据。由于传统的跨模式检索方法在处理海量、高维多模态数据时存在计算量大、效率低等问题,因此,研究人员关注到信息检索领域中常用的哈希算法,提出了跨模态哈希方法。跨模态哈希方法使用哈希码将图像和文本映射到同一向量空间,从而有效地降低了算法复杂度、提高了检索效率,目前已广泛应用于大规模跨模态检索中。
跨模态哈希方法通常分为两类:监督哈希方法和无监督哈希方法。有监督哈希方法包括语义相关最大化方法(Semantic correlation maximiza‑tion,SCM)[4]、语义保留哈希方法(Semantics‑pre‑serving hashing,SePH)[5]等。无监督哈希方法有潜在语义稀疏哈希方法(Latent semantic sparse hash,LSSH)[6]、媒体间哈希方法(Inter‑media hashing,IMH)[7]、语义主题多模态哈希方法(Se‑mantic topic multimodal hashing,STMH)[8]以及交叉视图哈希方法CVH(Cross‑view hashing,CVH)[9]等。但是,大多数早期的哈希方法都是基于浅层结构和人工特征提取的,无法描述不同模态之间复杂的非线性关系。
近年来,深度跨模态哈希方法利用深度神经网络的优势来捕获不同模态之间的相关性,因此比基于浅层结构的哈希方法更有效。……
