KNN优化的密度峰值聚类算法*
2021-08-06黄学雨程世超
通信技术 2021年7期
黄学雨,程世超
(江西理工大学,江西 赣州 341000)
0 引 言
聚类算法是一种常用的在数据集中寻找簇结构的方法,其目的是使得数据集中同一个簇内的数据具有最大相似性,不同簇之间具有最大差异性。在不同的科学领域具有广泛的应用,尤其在无人监督的学习场景中有着重要的应用[1-4]。根据聚类算法中样本空间中数据点之间目标函数定义方法不同以及各聚类簇内和簇间的数据对象间的关系,聚类算法一般分为基于划分的方法、基于层次的方法、基于网格的方法、基于密度的方法和基于模型的方法,其中基于划分的方法被广泛研究与应用[5]。
基于划分方法假设数据集可以用有限的聚类原型来表示,这些原型具有各自的目标函数,因此定义一个点和一个聚类原型之间的差异(或距离)是划分方法的关键。K-means算法是最流行的一种划分方法[6]。由于K-means算法的初始聚类中心设置对聚类效果影响较大,因此有效提高初始聚类中心的设置一直是K-means算法的研究热点。Pelleg和Moore[7]提出了X-means算法,通过在K-means的每次迭代中对聚类中心进行局部决策,并对其进行自我分裂,从而得到更好的聚类结果;Bezdek等[8]结合数学中的隶属度函数表示数据点属于类簇的概率值,提出了FCM算法,但该算法对初始聚类中心c和柔性参数m这两个参数较敏感;Khan等[9]提出以数据点间的距离均值、标准差等统计信息作为数据点的密度信息,即类中心自动初始化算法(Cluster Center Initialization Algorithm,CCIA)算法;Redmond等[10]通过构建k-d树计算出数据集中数据对象的密度分布情况,并利用数据点的密度信息获取数据集的初始聚类中心,提高聚类精准性;……
登录APP查看全文
