超簇加权的集成聚类算法
2021-12-13薛红艳钱雪忠周世兵
薛红艳,钱雪忠,周世兵
江南大学 人工智能与计算机学院,江苏 无锡 214122
集成聚类通过对基聚类实施组合策略以得到更好的结果,在发现奇异聚类、处理噪声和集成来自多个分布式源的聚类上具有较好的优势[1]。现有集成聚类算法的研究主要集中在两方面:一是如何生成性能好且有差异性的基聚类[2-5];二是如何设计一致性函数,如共协矩阵[6-9]、图分割[8]等方法得到集成聚类结果。
目前,大多数集成聚类算法仍存在三个局限性。第一,由于K-means 算法实现简单,计算复杂度不高且执行速度快,故大多集成聚类算法均使用Kmeans 方法生成基聚类[8-9]。但对于结构复杂尤其是边界不易区分、非球形分布或高维数据的数据集,使用K-means 算法无法产生较好的聚类结果,而质量较低的基聚类会影响共协矩阵的聚类结构,降低集成聚类的性能[8,10-11]。第二,大多数集成聚类算法忽视了基聚类多样性的不同,平等地对待每个基聚类[12]。第三,现有的集成聚类算法通常将数据对象作为生成共协矩阵的基本操作单元[8,11-12],当样本数目或集成规模较大时,计算负担明显增加。针对该问题,有研究者提出以相交簇作为操作单元[13-14]来降低算法的复杂度,但随着集成规模的增长,相交簇的数目显著增加,复杂度随之增加。
鉴于以上三个问题,本文提出了超簇加权的集成聚类算法(ensemble clustering algorithm based on weighted super cluster,ECWSC)。该算法首先提出一种新的生成基聚类的算法,即基于地标点的谱聚类算法。在对数据集使用基于地标点的谱聚类算法得到基聚类后,以信息熵为依据计算基聚类的不确定性,赋予基聚类相应的权重,并使用加权的方式得到基于超簇的共协矩阵。……