基于修剪树的优化聚类中心算法
2021-03-25周小亮吴东洋王玉鹏
周小亮,吴东洋,曹 磊,王玉鹏,业 宁
(南京林业大学信息科学技术学院,南京,210037)
聚类分析方法根据相似度将数据聚集到不同的类或簇中,使簇内数据有较高的相似度而簇间数据差异较大.聚类算法大致可分为五类:基于划分的方法、基于层次的方法、基于密度的方法、基于网格的方法以及基于模型的方法.其中,基于划分的k⁃means算法[1-4]可较好地识别球形聚类,具有较快的识别速度,但识别精度易受样本输入顺序的影响,算法稳定性差.基于密度聚类的DBSCAN(Density ⁃ Based Spatial Clustering of Applications with Noise)算法[5-8]可识别非球形样本,但受样本离群点影响较大,算法鲁棒性差.
多年来,研究者先后提出大量基于最小生成树的聚类分析算法,并得到了较好的聚类性能.2013年,徐沁和罗斌[9]将数据投影到主成分分析(Principal Component Analysis,PCA)子空间,给出自适应的mean⁃shift算法,并在PCA子空间内将数据向密度大的区域聚集;利用MST(Minimum Spanning Tree)与图联通分量算法找出类别树和类标签,计算数据在原始数据上的密度峰值,并将峰值点作为k⁃means聚类的初始中心点.与k⁃means算法相比,该算法能在较短的时间内给出较优的全局解.2014年,Ye[10]自定义SVNs(Single⁃Valued Neutrosophics)距离测度,并在此基础上提出基于SVM(Support Vector Machine)的广义距离测度的SVNMST(Single⁃Valued Neutrosophic Minimum Spanning Tree)聚类算法,并在实际数据集上取得较好的应用效果,但该算法的聚类精度受SVNs距离测度的影响较大.2014年,徐晨凯和高茂庭[11]提出改进的最小生成树自适应分层聚类算法,根据近邻关系为每个聚类簇设定独立的阈值,适应分布密度相差较大的情况,实验结果表明,在分布密度不均……
