APP下载

两阶段判别嵌入模糊聚类

2019-03-13支晓斌牛传林李亚兰

西安邮电大学学报 2019年5期

支晓斌, 牛传林, 李亚兰

(1.西安邮电大学 理学院, 陕西 西安 710121; 2.西安邮电大学 通信与信息工程学院, 陕西 西安 710121)

聚类[1]是统计多变量分析的方法之一,作为机器学习、模式识别和计算机视觉领域中的一种基本方法,其目的是将相似模式的数据分配到同一个类别中,不同模式的数据分配到不同类别中,并对数据内部结构进行重构。然而,高维数据的复杂性会影响聚类性能,即“维数诅咒”[2]。对高维数据聚类仍然是一个具有挑战性的问题。

判别聚类(discriminative clustering, DC)算法[3]将无监督的聚类方法和有监督的基于线性判别分析(linear discriminant analysis, LDA)[4]的降维方法组合在一个聚类框架中,交替执行初始数据空间中的LDA降维和低维变换空间中的聚类过程,实现了对高维数据的有效聚类,但是,该方法运行效率低。判别K-均值 (discriminativeK-means, DKM) 聚类算法[5]通过消除基于LDA的迭代降维过程,简化了DC算法,但存在小样本问题[6]。判别嵌入式聚类(discriminative embedded clustering, DEC)算法[7]通过交替执行基于子空间学习的降维方法和K-均值聚类方法,利用最大间距准则(maximum margin criterion, MMC)[8]代替DC聚类算法中的LDA方法实现对数据的降维处理,从而避免了LDA面对小样本的问题。但是,DEC算法的计算复杂度高,当数据维数较高时,运行速度慢。为了提高DEC算法的运行效率,改进的判别嵌入式(efficient discriminative clustering, EDEC)算法[9]先利用QR分解[10]实现对样本的初次降维,然后利用MMC对降维后的数据再次降维,通过两次降维,降低了DEC算法的计算复杂度,同时也提高了算法的聚类性能,但该算法对数据适应性较差。为了进一步改善EDEC算法……

登录APP查看全文