自动确定聚类中心的比较密度峰值聚类算法
2021-03-18,2*
,2*
(1.山东科技大学测绘科学与工程学院,山东青岛 266590;2.山东省基础地理信息与数字化技术重点实验室(山东科技大学),山东青岛 266590)
0 引言
随着互联网、社交网络等技术的迅猛发展,数据源的多样化使数据量呈现爆炸式的增长,如何在大规模数据集中进行有效的分析并挖掘背后的价值已经成为了众多行业面临的首要问题。聚类分析[1]作为一种重要的数据挖掘技术,能够在无监督的条件下探索数据背后潜在的数据结构。依据聚类算法原理的不同,可将现有的聚类算法大致分为五类[2-3]:划分聚类[4]、层次聚类[5]、密度聚类[6]、网格聚类[7]以及模型聚类[8]。k-means 算法[9]是著名的划分聚类算法,具有操作简单、效率高等优点,但需要预先指定聚类个数;基于密度的噪声应用空间聚类(Density-Based Spatial Clustering of Application with Noise,DBSCAN)算法[10]对密度估计使用了索引结构,在处理大规模数据集时,有效地提高了聚类速度,但容易受邻域半径和阈值这两个参数的影响;Ankerst 等[11]提出了OPTICS(Ordering Points To Identify the Clustering Structure)算法,该算法解决了DBSCAN 对输入参数敏感的问题;Frey 等[12]提出了一种与k-means 同属于划分聚类的近邻传播(Affinity Propagation,AP)聚类算法,该算法不需要指定聚类个数,但所得的聚类个数受“preference”的影响。
2014 年6 月,Rodriguez 等[13]首次提出了密度峰值聚类(Density Peaks Clustering,DPC)算法。该算法简单高效、无须迭代,能够检测任意形状的类簇,且不需要提前设定类簇的数量,目前在图像分割、医学影像处理、社区发现[14-17]等领域具有潜在的应用价值。但该算法也存在缺陷:1)采用欧氏距离进行距离度量,无法正确反映复杂数据集的分布情况;……
