APP下载

一种改进的距离度量的聚类算法

2012-09-26李健森白万民

电子设计工程 2012年22期
关键词:数据挖掘分类

李健森,白万民

(西安工业大学 陕西 西安 710000)

K均值聚类算法作为快速聚类法[1](又称动态聚类法)中最常用的一种,由于在计算速度上具有无可比拟的优势,常被作为大样本聚类分析的首选方案。其基本原理为:人为地或按照某种标准选择初始凝聚点;依据样品点到各初始凝聚点的欧氏距离,将样品划分到与其距离最近的类中,形成初始分类;再对初始分类进行修正,直到分类比较合理,不必再修正为止。而实际应用中度量分类对象的接近和相似程度并不一样,文中定义了一种新的聚类算法的距离度量用作分类的数量指标,从而可以定量地进行分类,应用新的距离度量之后,数据点的权重不再只为1或0,而是由系数来确定,这就将硬划分转化为软划分,提高了算法的执行效率。

1 问题提出

为了度量分类对象之间的接近与相似程度,需要定义一些分类统计量,用作分类的数量指标,从而可以定量地进行分类。常用的分类统计量有距离和相似系数,它们的定义与聚类分析的类型有关。

距离是聚类分析中常用的分类统计量。要对数据对象进行聚类,一般要计算各个数据对象之间的距离(相异度)。聚类分析中距离测度的选择一般有欧氏距离、马氏距离、绝对距离等等。但最常用的距离度量方法是欧几里得距离,其定义如下:

设两个P维向量x分别表示两个对象,它们的欧氏距离[2]为:

传统的K均值聚类分析,不考虑对象中每个变量在聚类过程中体现作用的不同,而是统一看待,用这样计算的距离来表示两个对象的相似度并不确切。……

登录APP查看全文

猜你喜欢

数据挖掘分类
分类算一算
垃圾分类的困惑你有吗
探讨人工智能与数据挖掘发展趋势
教你一招:数的分类
基于并行计算的大数据挖掘在电网中的应用
数据挖掘技术在中医诊疗数据分析中的应用
一种基于Hadoop的大数据挖掘云服务及应用
给塑料分分类吧
数据挖掘的分析与探索
基于GPGPU的离散数据挖掘研究