APP下载

基于密度的K-means初始聚类中心点选取算法

2022-07-08管彦允龚维印韦旭勤

绥化学院学报 2022年6期
关键词:实验

李 波 管彦允 龚维印 韦旭勤 薛 端

(六盘水师范学院数学与计算机科学学院 贵州六盘水 553000)

聚类算法在目前数据挖掘领域使用非常广泛的算法,其中基于划分的聚类算法是聚类算法中非常重要的一个分支[1],其算法核心思想是计算每个目标数据与聚类中心点的距离,把该数据点划分到离其最近的聚类。K-means算法是由J.B.MacQueen[2]提出的一种基于划分的聚类算法,由于该算法简单、有效,能快速把大量数据集划分到正确的聚类中[3],因此K-means聚类算法目前依然在数据挖掘领域占用非常重要的地位[4]。虽然经典K-means算法高效简单,但也存在一定的局限性:如果数据存在分布不均匀或存在离群点的情况,经典K-means算法会因为算法初始化时随机选择K个聚类中心导致出现聚类效果不佳和聚类差异性很大的情况[5]。

近几年国内外很多学者针对K-means算法的不足提出了大量的优化和改进策略。Elad M等人[6]提出基于距离和密度的方式查找聚类初始中心点。X Liu等人[7]提出通过计算每个点的距离,选择距离最大的点作为聚类初始中心点。Huang等人[8]提出了一种特征值加权的K-means算法,通过不同的权重在迭代过程中选择中心点。周本金等人[9]提出了通过方差方式选择初始聚类中心,解决聚类结果的不稳定问题优化K-means聚类。左进等人[10]提出了通过密度剔除离散点,选择密度均匀点作为聚类中心,该方法解决初始点的选择随机性导致聚类不稳定。ZHU E Z等人[11]提出选择高密度数据点作为聚类初始中心点,但是数据集中有离群点的情况下算法效果不佳。……

登录APP查看全文

猜你喜欢

实验
记住“三个字”,写好小实验
记一次有趣的实验
有趣的实验
做个怪怪长实验
NO与NO2相互转化实验的改进
实践十号上的19项实验
《实验流体力学》征稿简则
我实验,我快乐