APP下载

基于复杂网络的混合数据聚类分析

2021-08-30王依赟

太原科技大学学报 2021年4期

王依赟,许 英

(新疆财经大学 统计与数据科学学院,乌鲁木齐 830012)

随着社会的高速发展,人们对数据价值的认识逐渐加深。在这个大数据时代,人们希望从纷繁复杂的数据中提取到有价值的信息。聚类分析是数据挖掘的一个重要算法,是以相似性为基础,在一个聚类中的对象之间比不在同一聚类中的对象之间具有更多的相似性。

近年来,聚类算法中针对混合数据聚类最著名的方法是Huang提出的K-prototypes算法[1],该方法结合K-means与K-modes算法对混合属性数据进行划分,通过参数μi来控制数值属性与分类属性在聚类过程中的权重。

本文把复杂网络相关知识应用到混合数据中,针对混合数据的基于熵的相似矩阵,利用阈值法生成0-1矩阵(即复杂网络的邻接矩阵),进而构造复杂网络,对生成的复杂网络进行社团结构划分,复杂网络的一种社团结构划分就对应混合数据的一种聚类结果。

本文用三个数据集作为实验对象,通过和混合数据的聚类算法:DP-MD-FN、K-Prototypes、KL-FCM-GM、iEKP、OCIL算法进行比较,实验结果表明利用复杂网络社团结构划分算法得到的混合数据的聚类结果的准确性更高。

1 混合数据相似矩阵

1.1 概念

1.2 数值型的相似性度量

数值型的相似性度量可以采用欧氏距离,两个数值型数据的欧氏距离定义为:

dist(xi,xj)=‖xi-xj‖2

(1)

为了计算混合数据的相似度,采用一个单调递减函数将距离dist转化为相似度Sr[2-3],它是由一个指数函数给出:

(2)

其中Sr的值越接近1,两个对象越相似。

1.3 分类型的相似性度量

(3)

(4)

(5)

(6)

(7)

将式(7)代入式(4),可以得到分类属性的最终相似性测度,如下所示:

登录APP查看全文