基于密度峰值多起始中心的融合聚类算法
2021-11-26魏圆圆许桃胜
计算机工程与应用 2021年22期
梅 婕,魏圆圆,许桃胜
1.中国科学院 合肥物质科学研究院 智能机械研究所,合肥230031
2.中国科学技术大学,合肥230026
3.安徽省智慧农业工程实验室,合肥230031
聚类分析(Clustering Analysis)[1-5]是数据分析和信息挖掘的一种重要研究方法。在样本没有给定类别信息的情况下,聚类分析基于样本特征的相似性计算,确定样本的分组,同一分组的样本具有高度的相似性,而来自不同分组的样本之间相异度高。聚类分析方法一般需要确定聚类起始中心,进而迭代优化获得聚类结果。根据聚类算法的目标函数不同,概括有如下的聚类起始中心的定义方法:
(1)随机设定聚类起始中心[4,6],迭代寻找簇的划分使得目标函数得到最优解。典型算法如K-Means[7]。KMeans算法首先随机选取K个聚类中心点,计算每个样本到K个聚类中心点的距离,将样本划分到距离其最近的中心点所代表的类别,然后基于目标函数动态调整K个聚类中心点,迭代上述过程直至目标函数(即簇内距离平方和)最小。K-Means 算法采用样本空间距离最近的划分原则,因此不适用于非球型数据(如具有空间折叠结构的流型数据)的聚类问题。
(2)针对不规则形状的数据集,根据密度中心点[8-10]定义聚类簇中心。DBSCAN[11]是一种基于密度的聚类算法,通过将簇定义为密度相连的点的最大集合,能够将高密度区域划分为簇,并可在噪声数据中发现任意形状的聚类。在密度聚类方法基础上,Rodriguez 等提出一种基于密度峰值的聚类算法(Density Peaks Clustering,DPC)[12],聚类中心点的定义是具有较高局部密度且与比它密度大的点持有较大距离。……
登录APP查看全文
