基于熵的混合属性聚类算法
2021-04-22邱保志王志林
计算机工程与设计 2021年4期
关键词:分类
邱保志,王志林
(郑州大学 信息工程学院,河南 郑州 450001)
0 引 言
聚类是数据挖掘的主要技术,它将相似的对象聚在一起,不相似的对象分离开来。聚类技术广泛用于医学、互联网、金融、天气预报等领域的数据分析。通常情况下,实际领域的数据对象是既包含数值属性又包含分类属性的混合属性数据。传统聚类算法大多都只能处理单一属性的数据,例如K-means[1]、DBSCAN[2]、DPC[3]等算法只能处理数值属性的数据,而K-modes[4]、Fuzzy K-modes[5]等只能处理分类属性的数据。所以,研究混合属性数据聚类技术对于实际领域的数据分析有重要的作用。
相似性的度量对聚类的研究有着非常重要的作用。文献[6]提到的K-prototypes算法以及文献[7]和文献[8]的算法是将混合属性相似性度量拆分为数值属性相似性和分类属性相似性分别度量,然后再组合成混合属性的相似性,但这样存在一个问题:数值属性相似性和分类属性相似性度量的差异会造成聚类效果不佳。例如在UCI数据集Credit approval中,前两个对象的第一个分类属性“A1”的二元化距离为1,而这两个对象的第15个数值属性“A15”的欧式距离为560,由于数值属性间的距离远大于分类属性之间的距离,导致数值属性之间的相似性权重很小,甚至会忽略掉数值属性所体现的相似性特征,进而导致聚类质量的下降。其中,文献[7]中对使用欧式距离度量相似性的数值属性采用标准化来处理这个问题,但是这样做仍然不能消除数值属性相似性度量和分类属性相似性度量的差异带来的聚类效果不佳问题,其算法中使用的二元化距离度量分类属性相似性会使得分类属性相似性的权重缩小。……
登录APP查看全文
