基于谱聚类的全局中心快速更新聚类算法
2018-11-01邹臣嵩
计算机与现代化 2018年10期
关键词:定义
邹臣嵩,刘 松
(1.广东松山职业技术学院电气工程系,广东 韶关 512126; 2.广东松山职业技术学院机械工程系,广东 韶关 512126)
0 引 言
聚类分析作为一种探索性分析方法被广泛应用于模式识别、计算机视觉、数据挖掘等领域中,其目的是根据相似性原则将物理或抽象的对象集合分成若干个子集,并分析各子集中的数据之间的内在联系、规律和特点[1]。K-means聚类算法是应用最为广泛的划分方法之一,其实现简单、快速,并且能有效地处理大数据集,但该算法对初始聚类中心和异常数据较为敏感,且不能用于发现非凸形状的簇,因此聚类结果不稳定[2-3]。为了解决K-means算法的这些问题,研究人员围绕簇中心的选择与优化提出了新的计算方法[4-10],提高了原算法的聚类质量,减少了聚类时间,但这些改进的聚类算法更多注重初始聚类中心的选择,针对的对象往往是低维数据,因此,当数据的维度升高、分布相对稀疏时,其聚类结果难以预料,这是因为在高维空间中,数据对象间的距离几乎一致,所以基于距离和密度的聚类算法在面对高维数据集时,整体性能有所下滑[11]。此外,随着数据特征维度的增加,不相关的特征值会产生大量的冗余信息,在一定程度上屏蔽了那些与真实聚类结果关系密切的特征信息,从而进一步地影响了算法的聚类结果。因此,聚类算法的改进不仅需要寻找合理的初始聚类中心,还要对原始数据进行有效的预处理,尤其对于高维数据,在对其降维的同时,应尽可能地挖掘并保留能够对聚类结果的划分产生重要影响的“核心特征”。……
登录APP查看全文
