APP下载

基于谱聚类的全局中心快速更新聚类算法

2018-11-01邹臣嵩

计算机与现代化 2018年10期
关键词:定义

邹臣嵩,刘 松

(1.广东松山职业技术学院电气工程系,广东 韶关 512126; 2.广东松山职业技术学院机械工程系,广东 韶关 512126)

0 引 言

聚类分析作为一种探索性分析方法被广泛应用于模式识别、计算机视觉、数据挖掘等领域中,其目的是根据相似性原则将物理或抽象的对象集合分成若干个子集,并分析各子集中的数据之间的内在联系、规律和特点[1]。K-means聚类算法是应用最为广泛的划分方法之一,其实现简单、快速,并且能有效地处理大数据集,但该算法对初始聚类中心和异常数据较为敏感,且不能用于发现非凸形状的簇,因此聚类结果不稳定[2-3]。为了解决K-means算法的这些问题,研究人员围绕簇中心的选择与优化提出了新的计算方法[4-10],提高了原算法的聚类质量,减少了聚类时间,但这些改进的聚类算法更多注重初始聚类中心的选择,针对的对象往往是低维数据,因此,当数据的维度升高、分布相对稀疏时,其聚类结果难以预料,这是因为在高维空间中,数据对象间的距离几乎一致,所以基于距离和密度的聚类算法在面对高维数据集时,整体性能有所下滑[11]。此外,随着数据特征维度的增加,不相关的特征值会产生大量的冗余信息,在一定程度上屏蔽了那些与真实聚类结果关系密切的特征信息,从而进一步地影响了算法的聚类结果。因此,聚类算法的改进不仅需要寻找合理的初始聚类中心,还要对原始数据进行有效的预处理,尤其对于高维数据,在对其降维的同时,应尽可能地挖掘并保留能够对聚类结果的划分产生重要影响的“核心特征”。……

登录APP查看全文

猜你喜欢

定义
活用定义巧解统计概率解答题
例谈椭圆的定义及其应用
题在书外 根在书中——圆锥曲线第三定义在教材和高考中的渗透
永远不要用“起点”定义自己
严昊:不定义终点 一直在路上
定义“风格”
成功的定义
有壹手——重新定义快修连锁
修辞学的重大定义
山的定义