一种基于密度的增量k-means 聚类算法研究
2016-08-17司福明
长春工程学院学报(自然科学版) 2016年2期
司福明
(安徽机电职业技术学院信息工程系,安徽芜湖241002)
一种基于密度的增量k-means 聚类算法研究
司福明
(安徽机电职业技术学院信息工程系,安徽芜湖241002)
介绍了k-means和DBSCAN聚类算法的基本原理和优缺点,针对传统聚类算法无法有效处理高维混合属性数据集的问题,对原有的数据归一化方法进行改进,在k-means和DBSCAN聚类算法的基础之上,结合增量聚类的思想和数据之间相异度的计算方法,提出了基于密度的增量k-means聚类算法,有效处理具有高维混合属性的数据集,改进了数据相异度的计算方法。
k-means聚类算法;改进;数据相异度
0 引言
k-means算法是1967年由MacQueen首次提出的一种经典算法[1],经常用于数据挖掘和模式识别中,是一种无监督式的学习算法,其使用目的是对几何进行等价类的划分,即对一组具有相同数据结构的记录按某种分类准则进行分类,以获取若干个同类记录集[2]。k-means聚类是近年来数据挖掘学科的一个研究热点和重点,这主要是因为它广泛应用于地球科学、信息技术、决策科学、医学、行为学和商业智能等领域。迄今为止,很多聚类任务都选择该算法[3]。
1 k-means聚类算法
1.1 k-means基本思想
k-means聚类算法是经典的基于划分的聚类算法,它的目标是将数据集划分成k个簇,使每个簇中数据之间的相异度尽可能的小,而簇间数据之间的相异度尽可能的大[4]。由于k-means聚类算法思想较为简单,因此k-means聚类算法得到了广泛的应用。例如,基于距离的差异性函数,使得根据数据集的属性,在同一个簇中的对象是“相似的”,而不同簇中的对象是“相异的”[5]。……
登录APP查看全文