基于邻域归属信息混合度量的粗糙K-Means 算法
2021-03-18孙静勇马福民
孙静勇,马福民
(南京财经大学信息工程学院,南京 210023)
0 概述
聚类算法根据数据之间的相似度对数据进行划分,使得簇内数据相似度高,而簇间数据相似度低。现有的聚类技术主要分为密度聚类、划分聚类、层次聚类、模型聚类以及网格聚类[1]。K-Means 算法[2]作为划分聚类算法之一,使用类簇中心点来代表每个类簇,具有简单、高效的特征,是当前研究的热门聚类技术[3-4]。
为解决不确定信息的划分问题,文献[5]将模糊集引入K-Means 算法,提出了模糊K-Means(Fuzzy K-Means,FKM)[6]聚类算法,在处理数据对象时采用模糊度量。文献[7-8]将粗糙集理论融入K-Means算法,提出了粗糙K-Means(Rough K-Means,RKM)[9]聚类算法,解决了传统K-Means 算法不能处理粗糙不可分辨信息的问题。文献[10-12]将粗糙聚类算法应用于林业、医学成像、Web 挖掘、超级市场和交通工程等不同领域。文献[13]使用相对距离作为粗糙K-Means 算法相似性度量的标准,减少了边界区域离群数据点的影响。文献[14]对粗糙K-Means 算法中上下近似权重问题进行了完善。文献[15]为验证粗糙聚类算法的有效性,对粗糙聚类算法和传统聚类算法进行了更进一步的对比讨论。
粗糙集和模糊集都是处理不确定信息的有效手段,两者之间具有一定的互补性。文献[16]结合了粗糙集与模糊集,提出粗糙模糊K-Means(Rough-Fuzzy K-Means,RFKM)聚类算法,利用模糊隶属度对数据点进行加权度量,使得算法在处理不确定信息时更加合理、准确。文献[17]提出的模糊粗糙KMeans(Fuzzy-Rough K-Means,FRKM)则认为处于类簇下近似中的数据点是确定属于该类簇的,只有处于边界区域的数据点与类簇具有不确定关系。……
