一种中心权值流数据聚类算法*
2021-12-23曲守宁
通信技术 2021年10期
关键词:实验
华 峥,杜 韬,曲守宁
(1.山东开放大学,山东 济南,250014;2.济南大学,山东 济南,250022)
0 引言
近年来,数据流挖掘在网络监测、交通流量监控与管理、电力供应管理与预测、Web 点击流分析等领域有着巨大的应用前景[1]。与传统静态数据集不同,数据流的聚类分析提出了许多新的挑战:关于自然簇的数量和形状的先验知识难以获取;要求算法具有高度的灵活性,可以实时捕获任何形状的聚类;数据贡献可能会随时间不断变化,并且变化越早,对集群的贡献就越大[2]。
本文提出一种新的数据流聚类方法中心加权数据流聚类算法(Center-Weighted algorithm for clustering data Streams,CW-Stream)。该方法通过综合考虑量自动确定聚类中心,并且为了提供一个更好的聚类表征,通过中心权值的迭代学习过程,为聚类中心分配权重。此外,为把握数据对象的完整状态,本文方法以模糊隶属度矩阵的形式保存数据对象的摘要信息,且中心权值的加入为模糊隶属度带来了方向性的特征。通过一系列在真实数据集上的实验表明,CW-Stream 算法在聚类的纯度和效率等方面展现了良好的性能[3]。
1 聚类算法
CW-Stream 算法为了把握数据流的瞬态特征,将中心权重与距离特征相结合,以完成对数据流环境的准确描述,然后以模糊隶属度矩阵的形式保存数据流的摘要信息。算法不断重复上述迭代过程,直到数据流结束或者所有的数据点被全部遍历为止。
1.1 中心加权系数
在算法的具体执行过程中,一般关心的是当前数据的聚类情况,但如果对当前数据流的信息不敏感,算法挖掘性能和挖掘结果的精度将大大降低[4]。……
登录APP查看全文
