罚处共享最近邻密度峰聚类算法
2021-12-23高润峰苏一丹
高润峰,苏一丹,覃 华
(广西大学 计算机与电子信息学院,广西 南宁 530004)
0 引 言
密度峰聚类算法(density peak clustering,DPC),具有对初始点不敏感、能对各种形状进行聚类等优点[1]。但该算法也存在一些不足,例如:需要手动选择聚类中心点,主观性较大,自动化程度差;当簇的密度差异较大的时候,密度较小簇的中心点不容易被发现导致聚类结果不准确。针对这些问题,国内外学者进行了研究。Xie等用K近邻计算样本点的密度,并采用模糊加权K近邻来分配样本[2];Liu等提出用高斯核确定阈值来自动选择聚类中心[3];Liu Rui等通过共享最近邻和两次分配策略优化非簇中心点的分配[4];王洋等利用基尼系数自动识别聚类中心[5];Sun等提出一种基于数据分布和线性判断的自动选择簇中心方法[6];贾露等采用物理学中的万有引力来优化密度峰聚类[7];Zhao等将数据空间划分为圆形网格,通过网格相似度来实现密度峰聚类[8];Cheng等用密度核来避免噪声[9]。
上述改进的DPC算法中,共享最近邻密度峰算法(shared nearest neighbor density peak clustering,SNN-DPC)的聚类效果较好[4],但仍存在不能自动化选簇中心和容易忽略密度较小的簇等问题,针对这些问题,提出一种罚处共享最近邻密度峰聚类算法(penalty shared nearest neighbor density peak clustering,PSNN-DPC),主要思路是:首先找出罚处点,使用共享最近邻和罚处系数计算样本点的密度,然后再根据改进的样本密度确定与更高密度点的距离计算γ,根据迭代阈值方法γ进行迭代以选出聚类中心,接着采用二次分配策略将簇的非中心点分配到对应的簇中。通过在各种数据集上的实验,验证所提算法是可行的。……
