基于互信息量的改进K-Modes聚类方法
2012-10-21吴润秀
统计与决策 2012年6期
关键词:定义
吴润秀
(南昌工程学院计算 机系,南昌 330099)
0 引言
聚类算法常被称为一种无监督的学习方法,聚类分析是数据挖掘中的主要技术之一,聚类分析是根据组内相似度高,组间相似度低的原则将数据对象进行分类。在聚类过程中一个关键问题就是相似性度量的定义,当数据对象的每个特征均是数值型(实数,整数)时,相似性度量的定义有诸多选择,因为此种情形每个数据对象可用n维空间中的向量来表示(n为特征个数),则n维空间的距离(如欧氏距离,马氏距离,范数距离等)可用来定义对象之间的相似度,且这些度量只仅仅依赖特征向量之间的差值.然而在数据挖掘的应用中,有诸多数据对象是用类型数据来描述的,这使得我们不能通过计算两个特征向量值之差来表示对象之间的距离,最简单的办法是overlap,即若两个对象的属性值相等则为1,不相等则为0,这种简单匹配方法没有把整个数据集考虑进来,Boriah等[2]对类型数据的相似性度量做了较详细的综述和分析,分析了14种相似性度量及其在聚类中的优缺点,这14种相似性度量方法都只考虑了用同一属性值的分布特征来修正属性值之间的相似度,没有考虑数据对象属性之间的相互关系对相似度的影响,白亮等[6]通过用粗糙集中的上下近似集来定义两个属性值之间的距离,张小宇等[7]通过连接度来定义两个属性值之间的距离,Dino Ienco等[1]应用条件概率差来定义两个属性值之间的距离,他……
登录APP查看全文
