APP下载

一种连通合并优化的k近邻密度峰值聚类改进算法*

2021-04-22廖丽敏荣章权王洋

数字技术与应用 2021年2期

廖丽敏 荣章权 王洋

(广东顺德工业设计研究院(广东顺德创新设计研究院),广东佛山 528311)

0 引言

聚类是机器学习领域中无监督学习的一类算法,目标是将一组数据分成不同类簇,使得类簇内存在较大相似性,类簇间存在较大相异性[1]。大数据时代是数据分析方法的革新时代[2],面对越来越复杂、多样的数据,聚类作为重要的数据分析方法之一,近年来也越来越受关注。聚类中有很多经典的算法:基于距离划分的k-means算法、基于网格的STING和CLIQUE算法和基于密度划分的DBSCAN算法等。近年来随着深度学习算法的发展,也出现了诸如SOM等的人工神经网络聚类算法。现在学者们也逐渐开始对高维、庞大数据的复杂网格聚类进行相关研究。

2014年,Rodriguez和Lain[3]在《Science》发表的文章中提出了密度峰值聚类算法(Density Peaks Clustering,简称DPC)。相较于应用最广泛的k-means算法,该算法选取的聚类中心更加科学,而且根据密度划分可以更好地识别非球状簇,且该算法处理结果不带有随机性,结果更加稳定。

虽然DPC算法相较于k-means算法有很大的优越性,但是它依旧存在一些问题:(1)该算法的聚类中心依赖人为选取,人的主观性会影响聚类结果。(2)该算法在复杂分布的数据集中聚类效果很差[4]。本文针对DPC算法在复杂分布数据集中聚类效果不佳的问题,分析了具体问题及产生的原因并且在k近邻优化的DPC算法基础上,提出了一种连通合并优化的k近邻密度峰值聚类算法(k-nearest neighbor density peakclusteringalgorithmforconnec tedmergeoptimization,简称knn-DPCC)。本文介绍了改进算法的主要思想,主要步骤,并将该算法应用于数据集中进行验证,分类效果得以显著提升。……

登录APP查看全文