APP下载

基于二阶k 近邻的密度峰值聚类算法研究

2021-08-07王大刚丁世飞

计算机与生活 2021年8期
关键词:分配定义

王大刚,丁世飞,钟 锦

1.中国矿业大学 计算机科学与技术学院,江苏 徐州 221116

2.合肥师范学院 计算机学院,合肥 230601

聚类分析是用于模式识别和数据挖掘领域研究中的一个重要方法。20 世纪60 年代,最早的层次聚类算法[1]诞生,随后一大批聚类算法被相继提出,Kmeans[2]、谱聚类[3]、DBSCAN(density-based spatial clustering of applications with noise)[4]等常用经典算法一直沿用至今。根据文献[5]中的研究观点,现有的聚类算法大致可以分为[6-9]层次聚类、网格聚类、密度聚类、图模型聚类、划分聚类、代表点聚类、模型聚类共七大类方法。聚类算法在社交网络、舆情研究、图像识别、深度学习等领域有着广泛应用。

2014 年Rodriguez 等人[10]提出的密度峰值算法引起了学术界研究的一次新的研究热潮,算法通过定义局部密度和相对距离快速定位聚类中心,能够比较快速和高效地得到满意的聚类结果。尽管如此,算法仍然存在比较明显的缺点。DPC(clustering by fast search and find of density peaks)算法在计算局部密度时采用固定的截断距离,对节点周围的节点数据简单计数,针对密度有很大差异的数据集很难做出准确识别,不具备很好的鲁棒性。另外算法得到聚类中心后,通过单一的分配步骤,把非中心节点分配给相应的聚类中心点,分配过程一旦出错,会导致后续错误的层层传递。针对这些固有问题,学者们提出了一大批改进算法。

传统DPC 算法利用欧几里德距离计算节点之间相似度,对于非均匀和高维数据,无法得到满意结果。丁世飞等人[11]提出基于不相似性度量优化的密度峰值聚类,考虑节点周围的分布情况,用概率块重新度量节点的相似性,在不均匀数据和高维数据上有较好的识别精度。……

登录APP查看全文

猜你喜欢

分配定义
基于可行方向法的水下机器人推力分配
永远不要用“起点”定义自己
定义“风格”
应答器THR和TFFR分配及SIL等级探讨
遗产的分配
一种分配十分不均的财富
绩效考核分配的实践与思考
成功的定义
修辞学的重大定义
山的定义