针对时间序列数据挖掘的双加权聚类集成
2021-03-18胡健王海林肖鹏尹君
云南电力技术 2021年1期
胡健,王海林,肖鹏,尹君
(云南电网有限责任公司信息中心,昆明 650217)
0 前言
时间序列是一种广泛存在的数据,是由客观对象的某个物理量在不同时间点的采值按时间顺序排列成的序列数据,时间序列客观记录了所观测的系统在各个单位时间点上的状态值,所以可以通过研究时间序列数据来辨识、重构和预测所观测系统的行为模式。时间序列具有普遍存在性,多媒体数据,金融数据,气象数据,人口普查数据都是时间序列数据类型。研究如何有效地从这些复杂的海量时间序列数据中挖掘隐藏的、有价值的信息与知识,具有重要的理论价值和现实意义。时间序列数据挖掘(Time Series Data Mining)已成为数据挖掘研究领域中主要的研究对象[1]。时间序列数据挖掘巨大的科学意义与应用价值正在受到世界许多国家学术界、工业界和政府部门的普遍重视。2005 年,香港中文大学的研究者做了一项关于数据挖掘研究中最具挑战性问题的研究报告,将时间序列数据挖掘列为数据挖掘中最具挑战性的十大研究方向之一[2]。2014 年10 月,Twitter 公司开源了云环境时间序列数据断层检测工具Breakout[3]。2012 年,奥巴马政府投资2 亿美金启动“大数据研究和发展计划”,并在2017 年发布了第二轮大数据研究项目,其中白宫科技政策办公室正在建立流行病“天气预报”项目,旨在利用大数据方法,能够尽早对流行病作出识别和预测,以便预做准备,减轻症状,其本质就是时间序列数据挖掘[4]。
时间序列数据挖掘与传统的数据挖掘最大的区别在于其数据的时效性与有序性,是一个发现潜在有用的,与时间属性相关的信息与知识的过程,其主要包括时间序列相似性挖掘、特异性挖掘与规律性挖掘。……
登录APP查看全文
