基于微簇融合的密度峰值聚类算法
2021-10-15宋紫阳刘小康刘传修
宋紫阳,张 菁,刘小康,刘传修
(上海工程技术大学 电子电气工程学院,上海 201620)
0 引 言
聚类属于无监督分类,度量根据数据的相似性,将数据划分为不同簇,使得同簇中数据具有较高的相似性,不同簇的数据间具有较大差异性[1]。常见的聚类算法有三种:1)K-means算法属于基于分区的算法,参数设置简单,但该算法存在对聚类中心较为敏感、需要手动设置聚类中心个数和无法辨别噪声点的不足[2,3];2)BIRCH算法属于层次划分,聚类结果与数据输入顺序有关[4];3)STING算法作为基于网格划分算法,将空间划分为不同的网格单元[5],效果取决于网格的最低力度,太大或者太小都无法识别[6]。
基于密度的聚类算法属于典型非参数型算法,其样本点的分布具有某种概率[7]。Rodriguez A和Laio A[8]开发了一种密度峰值聚类(density peak clustering,DPC)算法,该算法可以根据决策图确定聚类中心并检测非球形聚类,而无需指定聚类数。文献[9]认为DPC算法的参数计算过于简单,忽略数据间的相关性,并在高维数据表现结果不佳,对此提出了ADPC-FLD算法,该算法引入皮尔逊相关系数来计算ρi和δi,采用Fisher对数据进行降维处理。文献[10]认为DPC算法过于依赖ρi和δi,存在参数选择的问题,提出了一种基于GSA的混合聚类方法(GSA-DPC),改进了截止距离的选择机制,提高聚类精度,并基于GSA框架设计了优化聚类中心的方法,采用遗传算法(GA)寻优。文献[11]认为当簇中含有多个密度峰时,DPC算法易将一个簇分为多个簇,提出一种基于支持向量机的新型合并策略(FDPC),利用支持向量机(SVM)计算每个聚类结果之间的反馈值,并根据反馈值进行微簇合并。……
