一种改进的距离度量的聚类算法
2012-09-26李健森白万民
电子设计工程 2012年22期
李健森,白万民
(西安工业大学 陕西 西安 710000)
K均值聚类算法作为快速聚类法[1](又称动态聚类法)中最常用的一种,由于在计算速度上具有无可比拟的优势,常被作为大样本聚类分析的首选方案。其基本原理为:人为地或按照某种标准选择初始凝聚点;依据样品点到各初始凝聚点的欧氏距离,将样品划分到与其距离最近的类中,形成初始分类;再对初始分类进行修正,直到分类比较合理,不必再修正为止。而实际应用中度量分类对象的接近和相似程度并不一样,文中定义了一种新的聚类算法的距离度量用作分类的数量指标,从而可以定量地进行分类,应用新的距离度量之后,数据点的权重不再只为1或0,而是由系数来确定,这就将硬划分转化为软划分,提高了算法的执行效率。
1 问题提出
为了度量分类对象之间的接近与相似程度,需要定义一些分类统计量,用作分类的数量指标,从而可以定量地进行分类。常用的分类统计量有距离和相似系数,它们的定义与聚类分析的类型有关。
距离是聚类分析中常用的分类统计量。要对数据对象进行聚类,一般要计算各个数据对象之间的距离(相异度)。聚类分析中距离测度的选择一般有欧氏距离、马氏距离、绝对距离等等。但最常用的距离度量方法是欧几里得距离,其定义如下:
设两个P维向量x分别表示两个对象,它们的欧氏距离[2]为:

传统的K均值聚类分析,不考虑对象中每个变量在聚类过程中体现作用的不同,而是统一看待,用这样计算的距离来表示两个对象的相似度并不确切。……
登录APP查看全文
