拉普拉斯矩阵在聚类中的应用
2019-06-21张艳邦
天津科技大学学报 2019年3期
刘 颖,张艳邦
(咸阳师范学院数学与信息科学学院,咸阳 712000)
随着信息时代的发展,各行各业都产生了大量的数据,人们不再满足数据仅仅被电子化,而是希望对数据进行分析挖掘,透过数据的表象,找到隐藏在数据背后的规律和结构[1].聚类分析是数据挖掘的一个重要工具,聚类分析的目的是从一个未知数据集中发现隐含在其间的数据内在结构信息,将数据划分为若干个不相交的子集,每个子集成为一个簇,同一个簇内数据相似性大,簇间数据相异性大[2].数据聚类分析主要面临两个问题:一是如何确定聚类的结构;二是现在的数据大都是高维数据,如何能在聚类前对数据进行降维,从而提高聚类的效率[3].这两个问题也是目前研究的热点.拉普拉斯矩阵(Laplacian matrix)也称为导纳矩阵,主要应用在图论中,作为一个图的矩阵表示,它广泛地应用在工程中[4-5].聚类问题从图的角度看就是对图的分割问题[6],因此拉普拉斯矩阵被应用到聚类分析中,出现了一种谱聚类算法(spectral clustering),该算法的核心思想就是把样本空间的聚类问题转化为无向图G的图划分问题[7].谱聚类算法在寻找聚类方面比传统算法(如k-means)更有效[8].然而,当数据集很大时,谱聚类的时空复杂度都比较大.为了对大数据集进行聚类,基于拉普拉斯矩阵,结合样本点的密度和距离,介绍了一种新的候选聚类中心选择方法.该方法先利用拉普拉斯矩阵对数据集进行降维处理,对经过降维处理的数据求出其密度和距离两个参数,从而形成密度距离决策图;……
登录APP查看全文
