Kmeans聚类算法局限性与策略研究
2020-02-14陈文静
商情 2020年2期
陈文静
【摘要】由于Kmeans聚类算法具有简单且聚类速度较快的特点因而在很多场景中被使用。本文从Kmeans聚类算法出发,首先对该算法的算法步骤进行简要描述;然后对该算法存在的局限性进行全面分析;最后针对相应的局限性提出对应的解决策略。
【关键词】Kmeans算法 局限性 解决策略
传统聚类算法中由于Kmeans聚类算法具有出色的速度和良好的可扩展性,从而使其成为应用最广泛的聚类算法之一。
一、Kmeans聚类算法简介
Kmeans聚类算法是一个重复移动类中心点的过程,把类的中心点,也称重心(centroids),移动到其包含成员的平均位置,然后重新划分其内部成员。Kmeans算法步骤如下:
输入:样本集为D={x1,x2,…,xn},聚类个数k;
输出:满足条件的k个聚类。
(1)从n个数据对象中随机选取k个对象作为初始的聚类中心;
(2)根据聚类均值(中心对象),计算每个对象与这些聚类中心的距离,并根据最小距离对相应的数据对象重新划分聚类;
(3)更新聚类的均值(中心对象);
(4)计算适应度函数,并验证函数是否收敛或者算法是否终止,如果函数未收敛或者算法未达到终止次数,则返回到步骤(2)。
二、Kmeans聚类算法局限性
聚类算法由于算法简洁易懂,理论可靠、可以处理不同类型的数据集等特点使其在人工智能、模式识别、图像处理、深度学习、医疗、生物工程以及政府等领域被广泛应用。目前聚类算法的分类方式可以采用层次法、划分法、密度法等进行。然而Kmeans聚类算法仍然存在一定的局限性。分别如下:
(一)k值的依赖性……p>
登录APP查看全文
