一种改进节点凝聚度的密度峰值聚类算法
2020-07-13吴辰文魏立鑫刘晓光
吴辰文,魏立鑫,刘晓光
1(兰州交通大学 电子与信息工程学院,兰州 730070) 2(兰州交通大学 电子与信息工程学院 计算机应用技术,兰州 730070) 3(兰州交通大学 电子与信息工程学院 软件工程,兰州 730070)
1 引 言
在数据挖掘领域中,聚类是一种无监督的学习方法,其目的就是将含有杂乱无章数据的集合分为若干簇,并且使簇中的数据尽可能相似,簇间的差别尽可能大[1],以便为我们提供有价值的信息.聚类分析在模式识别、医学、数据挖掘、图像识别等领域有着广泛的应用.
根据聚类原理将这些算法分为5类:基于划分的聚类算法(K-Means,Fuzzy C-Means等)、基于层次的聚类算法(Clustering Using Representative,Chameleon等)、基于网格的聚类算法(MAFIA,STatistical INformation Grid等)、基于密度的聚类算法(Density-Based Spatial Clustering of Applications with Noise,Ordering Points to Identify the Clustering Structure等)和基于模型的聚类算法(Self-Organizing Maps,Expectation-Maximization Algorithm等)[2-7].除了这些经典的算法之外,于2014年在《Science》学术期刊中发表了一种新的密度峰值聚类算法[8](Density Peaks Clustering,DPC)引起了广泛的关注.
DPC算法的核心思想是寻找被低密度区域划分开的高密度区域.利用局部密度ρ和不同簇高密度点之间的距离指标δ来生成“决策图”,并选取异常大的ρ、δ值作为类簇中心,将剩余数据点分配到已选取的类簇中心,直至完成数据点的分配.该算法具有简单高效、发现任意形状簇、样本归类无需迭代、参数设置少等优点,但是该算法规定每个簇中必须有密度最大的点作为簇中心,当数据分布不均或同一簇含有多个高密度点,很容易将一个簇分为几个子簇.近些年来,很多学者对密度峰值聚类算法进行了一些改进,并且也取得了一些研究成果,包括对聚类中心判断、经验截断距离dc的选择、密度计算方法改进等问题[9].例如,Ma C等[10]在文中指出,按照给定的评价指标对数据点排序,选取前m个最大值作为聚类中心;……
