APP下载

K-means聚类算法的一种改进方法研究

2021-06-10曾如明李云飞

邵阳学院学报(自然科学版) 2021年2期

曾如明,李云飞

(西华师范大学 数学与信息学院,四川 南充,637009)

聚类分析是处理多元数据分类问题、挖掘数据内在信息进行统计决策的常用方式,在生物医学、经济统计等领域也广泛使用[1-2]。常用的聚类分析方法包括基于划分的方法、基于层次的方法、基于密度的方法、基于网格的方法、基于模型的方法和基于模糊理论的聚类算法[3]。而K-means聚类因具有简单性及高效性,因而成为研究性最强的划分式聚类算法[4]。

但K-means算法的聚类划分结果在很大程度上取决于初始聚类中心的选择。为了解决这个问题,众多学者针对初始聚类中心的优化问题进行了研究。HUANG等[5]采用特征加权法选取初始聚类中心,综合考虑了每个属性数据对聚类结果的影响;JIANG等[6]首先在样本数据集中将离群点剔除后选取K-means聚类的初始聚类中心;ZHANG等[7]基于密度选取初始聚类中心的思想对其进行改进,研究结果表明,改进的K-means聚类算法具有更高的稳定性和准确性;YODER和PRIEBE[8]考虑到随机选取初始聚类中心造成的聚类效果差等原因,提出K-means++聚类算法。翟东海等[9]为了解决初始聚类中心距离太近的问题,将距离最远的2个样本作为2个初始聚类中心,选取到前两个初始聚类中心距离之积最大的样本点作为下一个初始聚类中心;马克勤等[10]将距离最远的2个样本点作为初始聚类中心,将剩余样本点与已知聚类中心距离最小值组成的集合中选取最大值所对应的样本作为下一个聚类中心;韩凌波[11]以每个样本为中心,将一定区域内所含样本点的个数来衡量样本的密度,选取密度较大的k个样本作为初始聚类中心;……

登录APP查看全文