K-means聚类算法的改进与应用
2020-03-31刘建花
太原师范学院学报(自然科学版) 2020年1期
刘建花
(晋中师范高等专科学校 数理科学系,山西 晋中 030600)
1 问题提出背景
随着计算机技术和网络技术的不断发展,我们身边大量的数据不断生成,如何利用这些数据显得尤为重要,数据挖掘就是我们要利用的工具.数据挖掘也称知识发现,采用科学的方法或手段,为人们从数据库中找出对自己有益信息或感兴趣的信息提供帮助.聚类分析属于数据挖掘技术的一种,在模式识别、图像处理等领域都有广泛应用,当中的聚类算法也有很多,如BRICCH,ROCK, DASCAN算法等.
基于K-means聚类算法属于聚类分析中基于划分的一种.它具有简洁高效和收敛性好的特点.K-means聚类算法中对初始聚类中心选择是非常重要的,选择不同的中心会造成完全不一样的聚类结果.此外在已有条件上分析确定聚类数目也很重要,事先给定的聚类数目同预期多多少少会有偏差,传统的K-means算法的选取中心点是随机的,如果选的不合适,有可能产生的是局部最优解,影响聚类正确性.为了弥补此缺陷,迫切需要对传统K-means聚类算法通过分析研究进行优化.
2 传统K-means聚类算法
2.1 算法思想
该算法的作用是解决聚类问题,把数据集的数据对象按照同一簇中的数据具有高相似度和与其他簇中的数据对象是低相似度划分条件将数据对象归类到不同的簇中[1].
算法分以下几个步骤:
第一步:首先输入n个数据对象.
第二步:先确定K,即聚类中簇的个数,然后从数据对象中随机选择聚类中心点K个.
第……
登录APP查看全文
