APP下载

基于结构化稀疏投影的多视图特征提取框架

2019-03-21帆,田

计算机技术与发展 2019年3期

江 帆,田 青

(1.南京航空航天大学 计算机科学与技术学院,江苏 南京 211106;2.南京信息工程大学 计算机与软件学院,江苏 南京 210044)

1 概 述

在实际的机器学习任务中,目标常常以多视图数据描述。例如,Web页面可以用文本、图像和链接等组件来共同描述,一个组件的数据是页面的一个视图。每一种视图都有其特殊的结构和独特的概念;而不同的视图又是相互关联的,因为它们描述的对象是相同的。多视图数据的这两种性质蕴含着多视图学习的两个原则:互补性和一致性[1]。一致性源自不同视图之间的相关性,互补性源自每个视图的独有信息。根据一致性和互补性,多视图降维算法可分为三类。第一类是只关注一致性,如凸子空间表示学习(convex subspace representation learning,CSRL)[2]和典型相关分析(canonical correlation analysis,CCA)[3-4]。第二类是只侧重于互补性,如多视图判别分析(multi-view discriminant analysis,MVDA)[5]和集成流形正则化稀疏低秩逼近(ensemble manifold regularized sparse low-rank approximation,EMRSLRA)[6]。最后一类是同时关注两种原则,如基于结构化稀疏的分解隐空间学习(factorized latent spaces with structured sparsity,FLSS)[7]和部分共享的隐因子学习(partially shared latent factor learning,PSLF)[8]。

而根据多视图数据的基本假设,多视图降维算法可以分为两类。第一种假设是低维表示只包含原始数据信息的一部分。不同的算法根据不同偏好提取相应信息,如判别信息和流形信息。投影学习模型(projection learning model)[9],如多视图典型相关分析(multi-view canonical correlation analysis,MCCA)[10]和MVDA,都是基于这种假设。另一种假设是不同的高维视图的数据是由相同的低维数据生成的。基于隐变量生成模型(latent variable generation model)[11-12]的算法,如高斯过程(Gaussian process,GP)[13-14]和CSRL,都是基于这种假设。

综合考虑两个原则和两个假设,多视图降维算法可以更细致地分为六类。……

登录APP查看全文