APP下载

一种基于多重信息的不完全数据的模糊C均值聚类算法

2021-12-08朱峥瑜

小型微型计算机系统 2021年12期
关键词:特征

朱峥瑜,宋 燕

(上海理工大学 光电信息与计算机工程学院,上海 200093) E-mail:sonya@usst.edu.cn

1 引 言

随着数据信息时代的来临,数据种类和数量不断增加,使得数据挖掘技术成为研究者们的热门话题.聚类是一种比较流行的数据处理方法,广泛应用于模式识别、机器学习、计算机视觉、图像处理等领域[1,2].聚类根据目标函数将一组样本进行同构划分,从而提高同一簇内的相似性,降低不同簇间的相似性[3].根据此种划分原理可定量地确定样本的相似性关系,从而获得研究对象合理划分.

在众多的聚类算法中,K均值算法[4]由于其简单、易于理解,是应用最广泛的聚类算法之一.在K均值算法中,每个样本属于某一确定的簇,并通过“簇内距离平方和最小化”准则来实现对样本的划分.K均值算法对数据的归属是一种硬性的划分(即:反映样本隶属于某个簇的程度的值只能取0或1)[5].然而,现实中的数据往往具有簇的不确定性,因而导致簇之间存在模糊边界.基于此,在聚类分析中引入模糊划分的概念十分必要.Bezdek[6]提出的模糊C均值(FCM,Fuzzy C Means)算法是一种典型的模糊聚类算法.FCM算法中隶属度可以取0~1之间的任何数,并且通过“簇内距离平方和最小化”准则来实现对隶属度的模糊化.

尽管FCM算法的提出解决了不确定性数据集的聚类问题,但其本身还具有一些固有的缺点[7],比如模糊指标m的选择,对噪声数据和初始聚类中心敏感,迭代容易陷入局部极值点等[8].迄今为止,有很多学者对传统FCM算法的改进研究做出了巨大贡献,例如文献[9]中用闵可夫斯基距离代替欧式距离,使聚类算法能适用于复杂几何形状的数据;……

登录APP查看全文

猜你喜欢

特征
离散型随机变量的分布列与数字特征
具有两个P’维非线性不可约特征标的非可解群
月震特征及与地震的对比
如何表达“特征”
不忠诚的四个特征
詈语的文化蕴含与现代特征
基于特征筛选的模型选择
线性代数的应用特征