改进的深度编码器在多模态特征学习中的应用
2021-12-09徐凤平
徐凤平
多模态特征学习的关键在于如何挖掘不同模态之间的关联性.目前有许多基于传统统计机器学习的多模态数据分析方法,如支持向量机SVM、Latent Dirichlet Allocation(LDA)、Independent Component Analysis(ICA)等.这些方法都属于浅层模型,对高维关联的挖掘存在困难,很难获得准确的多模态特征表示.目前主流的基于深度学习的多模态特征融合模型往往采用单融合点结构,它们在最顶层空间仅仅进行了一次模态交互.
早期的研究人员主要是采用基于浅层模型来挖掘模态间的关联性.BLEI等人针对多模态检索问题的特点提出了面向“文本-图像”多模态数据的相关LDA模型[1].XING等 人提出了一种基于特殊的无向图模型的双翼式模 型(Dual Wing Model)[2].RASIWASIA等 人 提出了一种基于典型关联分析(Canonical Corre⁃lation Analysis,CCA)的多模态特征融合模型以进行跨模态检索[3].这些多模态特征学习方式可以归类为由一到两层结构组成的浅层模型.由于来自于不同模态的数据之间的数值形式及统计特性相差巨大,所以在浅层模型结构定义的低维空间中,不同模态数据特征之间关联性的耦合度不高.
随着深度学习的不断发展,神经网络在挖掘文本、图像等模态高维特征上的优越性充分得到了体现.SU等人使用LSTM和CNN搭建了一套基于音频和图像特征的多模态深度学习系统(audio-visual speech recognition sys⁃tems,ASVR),学习音频和图像间的跨模态关联[4].HU等 人借鉴循环 神经网络(Recurrent Neural Network,RNN)的思想,对传统的多模态受限玻尔兹曼机进行改进,提出了循环多模态受限玻尔兹曼机(Recurrent Temporal Multimodal Restricted Boltzmann Machine,RTMRBM),解决图像语音识别问题[5].HOU等……
