一种基于序列到序列模型的时间序列插补
2021-07-19周茜,向维
周 茜,向 维
(北京信息科技大学 自动化学院,北京 100192)
0 引言
多变量时间序列包含多个数据流,这些数据流反映了复杂系统的多种特征参数随时间的变化[1]。每一个特征除了有其自身时间趋势之外,不同的特征之间还相互关联[2]。多变量时间序列数据主要作为历史演变信息来预测复杂系统的未来状态,从而帮助人类做出明智的决策。然而,在实际情况中,由于通信错误、传感器故障等原因,多变量时间序列数据中通常存在缺失数据[3]。缺失值的存在会减少关于复杂系统的未来状态的重要信息,从而增加了预测任务的难度[4]。因此,开发有效的多变量时间序列插补方法是一个重要的研究课题。
缺失数据的插补方法始于统计概率分析,通过分析时间序列的概率分布来获取缺失值的相关信息,从而修复缺失值。例如Qu等[5]利用概率主成分分析(probabilistic principal component analysis,PPCA)方法来预测交通流中丢失的数据。但是,PPCA对时空相关性的提取并不完全适用,导致插补性能降低。Fekade等[6]提出了一种概率矩阵分解(probabilistic matrix factorization,PMF)方法,通过使用相关传感器的数据来填充不完整的数据。PMF利用了在同一时间点从不同传感器收集的测量值之间的相关性,但是忽略了时间相关性。门控递归单元(gated recurrent unit,GRU)和长短期记忆网络(long short-term memory,LSTM)等循环神经网络(recurrent neural network,RNN)具有出色的长期时间依赖性模拟能力,因此被广泛应用于时间序列插补中。Zhang等[7]提出了一种基于LSTM的序列到序列插补模型(sequence-to-sequence imputation model,SSIM),用于修复无线传感器网络中的连续缺失值。但是,SSIM假设输入的多变量时间序列中的所有数据流都具有相同的丢失率[8],且需要完整的数据集进行模型训练。……
