xk-split:基于k-medoids的分裂式聚类算法
2018-01-03陈逸斐虞慧群
华东理工大学学报(自然科学版) 2017年6期
陈逸斐, 虞慧群
(1.华东理工大学计算机科学与工程系,上海 200237; 2.上海市计算机软件重点测评实验室,上海 201112)
xk-split:基于k-medoids的分裂式聚类算法
陈逸斐1,2, 虞慧群1
(1.华东理工大学计算机科学与工程系,上海 200237; 2.上海市计算机软件重点测评实验室,上海 201112)
近年来互联网数据规模呈爆炸式增长,如何对大数据进行分析已成为热门话题。然而,采集的数据很难直接用于分析,需要进行一定程度的预处理,以提高大数据质量。通过使用分裂式的迭代过程,可以逐步将数据集分裂为子集,避免了传统聚类算法聚类开始时需要确定集群数的限制,并降低了算法的时间复杂度。此外,通过基于阈值的噪声数据过滤,可以在迭代过程中剔除噪音数据,提升了聚类算法对脏数据的忍耐力。
数据挖掘; 聚类; k-means; k-medoids; 分裂
数据的聚类算法是机器学习与数据挖掘中的一大命题,广泛应用于机器学习、数据挖掘、图像分析、模式识别等领域中。而聚类算法又可分为硬聚类和软聚类算法,其中硬聚类算法将目标数据明确地划分为不同集群,代表算法为k-means算法;而软聚类算法又称模糊聚类算法,数据点可能属于一个或以上的集群,且数据点与集群通过成员水平互相联系,代表算法为模糊C-均值(FCM)算法。本文针对聚类算法中的硬聚类算法展开讨论。
聚类分析的主要工作是将较大规模的数据通过静态分析的手段划分为更小的子集,每个子集内部的对象有共同的特征。聚类分析的手段主要分为结构型与分散型算法。……
登录APP查看全文
