APP下载

自适应时间平滑的演化谱聚类

2021-11-10姜玉麟徐晓华林惠惠葛方毅

南京航空航天大学学报 2021年5期

何 萍,姜玉麟,徐晓华,林惠惠,葛方毅,方 威,仁 祥

(扬州大学信息工程学院,扬州 225009)

聚类作为数据挖掘领域中一种非常有效的数据分析方式,其主要是将数据间相似度较高的数据样本划分到同一簇中,将相似度相差较大的划分到不同的簇中。传统的聚类算法往往在静态数据的处理上具有良好的效果,但在实际问题的处理中,数据往往是随时间的推移而变化的,通过聚类挖掘数据的演化机制,并且保证聚类结果在时间上尽可能平滑,即当前时间快照上的聚类结果应该与历史快照上的聚类结果要尽可能地相似。

传统的机器学习的基本假设是所有的数据都是独立同分布的,不会随着时间的推移而发生变化,也不会随着时间的推移出现数据的增加或衰减的情况。比如在文本的挖掘、图像的合成、分割等任务中,假设训练数据集和测试数据集的数据都是在一定的时间点,从一个概率分布中独立地抽取得到的。然而在一些实际应用问题的数据分布是随着时间动态变化的,例如,在新闻、博客和BBS 等在线媒体中,人们讨论的话题大多数都会随着时间发生变化,即使对于同一个话题,一年前和当前的内容也不完全相同,这被称为概念漂移[1]。

图1 演示的是演化数据随着时间的分布移动。图1(a~d)分别是不同时刻的数据分布。从图中可以看出,T1~T4时刻有3 个簇,分别用红、绿、蓝表示。随着时间推移,图1(b~d)中3 个簇的位置发生变化。由此可见,演化数据在时间的推移过程中,数据的位置分布和相互关系往往会发生变化。……

登录APP查看全文