APP下载

一种改进的混合遗传聚类算法的数据挖掘技术

2010-08-07崔志刚

网络安全技术与应用 2010年3期
关键词:数据挖掘分类

崔志刚

武汉大学软件工程国家重点实验室 湖北 430063

0 引言

数据挖掘(Data Mining)就是从大量数据中获取有效的、新颖的、潜在有用的、最终可理解的模式的非平凡过程。在庞大的数据集合中存在相似性很强的数据集,如果能将数据集进行分类,依据相似性建立一个种群,使得数据挖掘更有目的性和针对性。K-means聚类算法是一种快速有效的分类方法,具有较快的分类速度,但必须手动确定初始聚类中心,因此,若能够利用算法求得初始聚类中心,则结合K一均值聚类算法可以实现自动分类。遗传算法(Genetic A1gorithm—GA)是模拟达尔文的遗传选择和自然淘汰的生物进化过程的计算模型,它是一种启发式的全局优化搜索算法,其简单通用,鲁棒性强,适于并行处理,应用范围广。遗传聚类是将GA应用于聚类的一种方法,其基本思想是通过遗传学习,将上一代的优良特性保留下来,并通过个体之间的基因组合、变异从而产生更为优良的下一代个体,这样经过数代的个体进化,最终找到满意的个体。鉴此,本文采用K-means算法进行聚类,并采用遗传聚类算法确定聚类中心,实例结果验证了改进的算法有效可行。

1 K-means聚类算法

在聚类算法中需要考虑到底聚类算法到什么时候终止,即是如何确定聚类中心,确定多少聚类中心。K-means聚类将数据划分为n个模式,每个模式的维度为d,取其中的最小K组作为我们的聚类起点,定义如下:

令{xi,i=1,2,…,n}为模式n的集合。其中xij表示xi的第j个特征。定义i=1,2,…,n;k=1,2,…,K,

那么,数组W=[wij]就有属……

登录APP查看全文

猜你喜欢

数据挖掘分类
分类算一算
垃圾分类的困惑你有吗
探讨人工智能与数据挖掘发展趋势
教你一招:数的分类
基于并行计算的大数据挖掘在电网中的应用
数据挖掘技术在中医诊疗数据分析中的应用
一种基于Hadoop的大数据挖掘云服务及应用
给塑料分分类吧
数据挖掘的分析与探索
基于GPGPU的离散数据挖掘研究