APP下载

基于熵与邻域约束的模糊C均值改进算法

2021-12-09冯俊淇张正军

计算机与现代化 2021年11期

冯俊淇,张正军,章 曼,严 涛

(南京理工大学理学院,江苏 南京 210094)

0 引 言

聚类分析是一种常用的无监督学习算法,对于一组未知类标签的数据集,它能够根据样本间的相似性,将样本划分到对应的类别,从而使同一类别中样本相似度较高,不同类别间样本相似度较低。近年来,随着数据爆炸式增长,聚类分析被广泛应用于图像处理、数据挖掘、机器学习等领域。

聚类方法发展至今,已有许多成熟算法:划分聚类算法K-means[1]和K-medoids[2]、密度聚类算法DBSCAN[3]、层次聚类算法CURE[4]、网格聚类算法STING[5]等。

根据隶属度取值方法,聚类算法可以分为硬聚类算法和软聚类算法。传统聚类算法中的K-means就是硬聚类算法,样本的隶属度取值是0或1,即样本只能属于一类,这种“非黑即白”的分类方法并不符合生活中的现实关系。1973年Dunn[6]将模糊关系引入到K-means算法,提出了模糊C均值(FCM)算法,1981年Bezdek[7]将模糊指数引入目标函数,扩展了算法的一般性。

尽管模糊C均值(FCM)算法应用于现实生活中的诸多领域,但是仍存在一些不足:1)算法中采用欧氏距离作为相似性度量,未考虑数据的各属性对聚类的影响不同,导致聚类效果不理想;2)聚类过程中仅考虑样本与聚类中心的距离,没能有效利用邻域样本的信息,造成边界样本和噪声样本错分率较高。近年来,许多专家学者针对FCM算法缺点提出了改进,取得了丰厚的研究成果。文献[8-11]通过对数据赋予权重的方法来优化算法,提高聚类性能;文献[12-14]利用不同的方法对聚类中心初始化,有效减小了噪声点对聚类过程的影响,提升了聚类的准确性;……

登录APP查看全文