基于属性加权的不完全数模糊c均值聚类算法
2012-05-31李丹,顾宏,张立勇
李 丹, 顾 宏, 张 立 勇
(大连理工大学 控制科学与工程学院,辽宁 大连 116024)
0 引 言
聚类是数据挖掘、模式识别等领域的重要研究内容之一,在识别数据内在结构方面具有重要作用.模糊c均值(fuzzyc-means,FCM)算法[1]是一种基于目标函数的有效的聚类算法,该算法能够将p维完整的目标数据集X= {x1,x2,…,xn}Rp划分为若干模糊子类.然而,在模式分类应用中,由于数据采集失败及随机噪声等原因,很多数据集是不完全的,即数据集包含缺失部分(非全部)属性值的样本,而FCM算法不能直接应用于不完全数据集的聚类分析.
为了消除缺失属性对聚类分析的影响,有关文献提出了各种不完全数据集的模糊聚类算法[2-8].Miyamoto等[2]提 出 了 几 种 在 模 糊c均 值算法中处理不完全数据的方法,其中一种简单方法是以相应属性的加权平均值估算缺失属性值,另一种方法则忽略数据集中的缺失属性并通过完备属性进行距离测算,这两种方法即后来解决不完全数据聚类问题的常用策略:估算(imputation)法及舍弃(discarding/ignoring)法.之后,Hathaway等[3]提出了基于FCM进行不完全数据聚类的几种具体方法,其中 WDS(whole data strategy)是一种最简单的方法,该方法舍弃样本集中所有包含缺失属性的样本,利用剩余完备样本得到聚类中心及完备样本的类属,不完全样本的类属则通过其与各聚类中心的局部距离[9]确定,但这种对数据集的约简将造成信息的大量丢失;另一种方法为PDS(partial distance strategy),即忽略不完全样本的缺失属性,FCM算法中的距离仍采用Dixon提出的局部距离[9]计算;……
