APP下载

聚类算法研究综述

2018-10-21郑强高群

科技信息·中旬刊 2018年9期

郑强 高群

摘要:随着数据挖掘技术的迅速发展,作为其重要的组成部分,聚类技术已经被广泛应用于数据分析、图像处理、市场研究等许多领域。聚类算法研究已经成为数据挖掘研究领域中非常活跃的一个研究课题。本文分析了各类常见聚类算法的应用场景及优缺点,指出了聚类分析研究重点关注内容。

关键词:聚类;划分聚类;层次聚类

1 引言

同时,聚类作为数据挖掘的主要方法之一,越来越引起人们的关注。聚类[1]分析是一种无先验知识的机器学习过程,是数据挖掘一个重要的分支,遵循同一个集合中的样本相似性最大,不同集合中的样本差异性最大的思想,把样本集分为若干个集合,每个集合称为一个簇。通过聚类, 人们能够识别密集的和稀疏的区域, 发现全局的分布模式以及数据属性之间有意义的相互关系。

聚类算法在计算机科学、生医学、地球科学、社会科学、经济学等领域都有广泛的应用。已有的经典聚类算法大致可分为五种:基于划分的、基于层次的、基于密度的、基于网格的和基于图论的聚类。本文比较了数据挖掘中典型的聚类算法,分析了它们各自的优缺点并指出了其面临的挑战。

2典型聚类算法

2.1划分聚类方法

划分聚类[2]将数据对象划分成不重叠的子集,使得每个数据对象都分布在不同的子集中。最经典的聚类算法是K-Means[3],其主要思想是找出数据集的k个聚类中心,把数据集划分为是k个类簇,使得数据集中的数据点与所属类簇的类中心的距离平方和最小。……

登录APP查看全文