基于相似度的蚁群聚类算法∗
2021-06-29沈兴鑫杨余旺肖高权徐益民陈响洲
沈兴鑫 杨余旺 肖高权 徐益民 陈响洲
(1.南京理工大学计算机科学与工程学院 南京 210094)
(2.湖南云箭集团有限公司 怀化 419500)
1 引言
聚类[1](Clustering)是一种重要的数据挖掘分析方法,主要目标是在海量数据中找出相似的数据并按照相似度分为不同的类,从而使得一个集群内的数据项彼此相似,不同集合中的数据尽量不同。从生物学到社会学再到计算机科学等众多领域都存在相同的需求,因此聚类算法得到了广泛的应用。
蚁群聚类(Ant Colony Clustering)是一种受蚁群启发的聚类算法。意大利学者Dorigo M[2]在模仿蚂蚁群体行为的基础上提出了蚁群算法,根据蚁群的信息素机制寻找蚁穴和食物间的最短路径,并有效地解决TSP问题。Deneubourg J[3]基于人工蚁群模型结合蚂蚁的堆尸行为提出了聚类算法(Basic ant colony clustering model,BM)。Lumer E D和Fa⁃ieta B[4]在BM模型的基础上改变蚂蚁移动速度提出了LF模型,很好地解决了大数据量时的聚类问题。
相比于其他的聚类算法,蚁群聚类有以下几个优点,如灵活性、鲁棒性、分布性和自组织性。因此该算法被更多的人研究并改进。Bin W和Zhong⁃zhi S[5]研究了相似系数,并提出了一种更简单的概率转换函数。王慧和甘泉[6]加入了参数自适应调整策略,提高了蚁群聚类的准确性。乔少杰[7]研究了蚁群的分布式模型在文本聚类中的应用。Tan S C等[8]提出了一种简化的基于蚂蚁的聚类方法,该方法基于现有的基于蚂蚁的聚类系统的研究。林金灼[9]结合了主成分分析方法(Principal Compo⁃nent Analysis,PCA),提高了蚁群的聚类质量。Tao等[10]重新定义了两个数据对象之间的距离,并改进了蚂蚁丢弃和拾取数据对象的策略,从而提出了一种改进的蚁群聚类算法。……
