一种改进的模糊C-均值聚类算法
2012-03-22曹易,张宁
上海理工大学学报 2012年4期
关键词:有效性
曹 易, 张 宁
(上海理工大学管理学院,上海 200093)
聚类是根据对象之间的相似性来将他们聚集成不同类别的方法.评价一个聚类质量的好坏,总体是该聚类结果中同一类内部的对象尽可能相似,不同类之间的对象尽可能相异.到目前为止,数据挖掘中常用的聚类算法有层次聚类、划分聚类、基于网格聚类、基于密度聚类及模糊聚类等[1].
传统的聚类是一种硬性划分,具有“非此即彼”性,但是,现实生活中很多事物是“亦此亦彼”,很难将它们严格地划分到一个具体的类中.模糊C-均值聚类算法(FCM)是应用最广泛的聚类算法之一[2],它具有算法简单、收敛速度快、能处理大规模数据等优点,因此,该算法已经有效地应用在数据挖掘、模式识别及决策支持等领域,具有很大的理论以及实践价值.但是,FCM算法同时也存在着很大的局限性[3]:聚类数与聚类初始中心的选择极大地影响着聚类效果,并且该算法采用梯度法求解极值,所求解往往是局部最优.为此,文献[4]用信息熵来计算最佳聚类数目,Yager和Filev[5]提出了一种称为爬山法的初始聚类中心方法.
由于一般模糊C-均值算法的上述缺点,本文提出了一种改进的FCM算法.首先用概率密度的思想得到最佳聚类数和初始聚类中心,其次通过对拥有次大隶属度的中心点加入一个抑制因子来加速算法收敛,最后用一个兼顾类内距与类间距的新的目标函数来替代原有的目标函数.经实验证实,该算法在聚类结果质量……
登录APP查看全文
