APP下载

面向预测的长短时神经网络记忆增强机制

2021-11-12吴明慧侯凌燕

计算机工程与应用 2021年21期
关键词:记忆信息模型

吴明慧,侯凌燕,王 超

1.北京信息科技大学 计算机开放系统实验室,北京100101

2.北京材料基因工程高精尖中心,北京100101

时间序列预测方法在目标追踪、天气预报、市场分析和故障诊断领域中有广泛的应用。时间序列预测的目标是寻找未来时刻序列的取值与其历史观测值及变量之间的关系[1-2]。深度学习(deep learning)通过建立深层神经网络实现自动特征提取,构建数据在不同层级、维度下的关联,提高自变量对因变量的解释程度[2-5]。

目前,用于时间序列预测的深度学习模型主要有循环神经网络(Recurrent Neural Network,RNN)和长短时神经网络(Long Short-Term Memory neural network,LSTM)[6]。基于时间(状态)的循环机制,RNN能将时间序列的上下文信息考虑在内,但在训练过程中存在梯度消失问题(即梯度向量的分量在长时序列上呈指数降低)[7-15]。Schmidhuber等人提出长短时神经网络,在RNN的基础上设立细胞状态保存历史信息、设立输入门更新细胞状态、设立遗忘门清除无用历史信息,从而分离了记忆模块与数据输入模块,缓解了梯度消失问题[3]。进而,涌现出诸多基于LSTM模型在预测领域的应用案例,例如Yuan等[15]对工业设备寿命的预测。然而,后续的研究发现梯度消失问题在LSTM中仍然存在,尤其在工业环境中,时序数据往往由高采样率的传感器收集得到,随采样时间的增加,序列长度不断增长,在处理距离当前时刻较远的序列信息时这个问题更加明显[16]。

为解决此问题,Chorowski等人[17]提出在LSTM之后增加注意力机制,通过为隐层节点分配不同权重,使重要特征在长序数据的学习过程中被保留。……

登录APP查看全文

猜你喜欢

记忆信息模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
订阅信息
记忆中的他们
3D打印中的模型分割与打包
儿时的记忆(四)
儿时的记忆(四)
记忆翻新
展会信息
健康信息