基于密度敏感距离的改进模糊C 均值聚类算法
2021-05-17王治和王淑艳
计算机工程 2021年5期
王治和,王淑艳,杜 辉
(西北师范大学计算机科学与工程学院,兰州 730070)
0 概述
聚类分析是将样本对象划分成子集的过程,即把每个子集作为一个簇,簇中的对象相似程度高,不同簇中的对象相异程度高。目前,聚类分析已被广泛应用于数据挖掘、模式识别和图像处理等领域,很多经典算法被提出用于样本对象的聚类,主要有基于划分、层次、密度、网格和模型五大类[1]。模糊C 均值(Fuzzy C-means,FCM)聚类算法是一种基于划分的聚类算法,其因简洁、高效而得到了广泛的应用[2],但在建立相似度矩阵、随机初始化聚类中心和预先确定聚类数目等方面还存在不足。在建立相似度矩阵的过程中,FCM 算法采用欧氏距离的相似性度量只对凸数据具有良好的处理性能,在复杂形状和非凸数据中往往会失败,因此,确定合适的相似度矩阵是提高FCM 算法聚类性能的关键因素。
相似度矩阵依赖于距离度量这一特点,吸引了很多学者的研究与关注。文献[3]提出一种基于加权欧氏距离的改进FCM 算法,其中加权欧氏距离是将特征权值合并到常用的欧氏距离中,结果表明,适当的特征权值分配可以提高FCM 算法的聚类性能。文献[4]引入一种鲁棒的非欧氏距离度量方法来提高传统FCM 算法的效率,从而减少噪声和异常值对聚类性能的影响。文献[5]提出使用马氏距离和闵可夫斯基距离来代替欧氏距离,提高了FCM 算法对于高维数据的识别能力。文献[6]提出一种基于散度相似性度量的FCM 算法,其对噪声特征的扰动具有更强的鲁棒性。……
登录APP查看全文
