APP下载

带动量项的梯度下降算法的收敛性

2021-12-30彭先伦

彭先伦, 谢 纲

(华东理工大学数学学院,上海 200237)

前馈神经网络目前已经得到了广泛的应用[1-2],而反向传播算法则被广泛运用于神经网络训练中,并且它的收敛性也在文献[3-4]中得到讨论。在反向传播算法中,经常会加入动量项来加速训练和使训练过程更稳定[5]。在有动量项的反向传播中,当前权重的更新量是损失函数对该权重参数的当前梯度与之前权重更新量的线性组合。

许多学者对有动量项的反向传播算法(BPM)进行过研究[6-8],文献[9]中给出了动量反向传播算法的稳定性分析,结果表明BPM 的稳定点就是平方误差损失的局部极小值,其他平衡点不稳定。Qian 在文献[10]中也讨论过BPM,表明系统在局部极小点附近的行为等价于一组阻尼谐波振荡器,动量项通过使系统的某些本征分量更接近临界阻尼来提高收敛速度。这些研究只是描述训练迭代过程在损失函数的局部极小值附近的行为,不能用于更一般的情况,比如随机选择初始权重。文献[11-12]中探讨了BPM 的收敛性,研究中限制损失函数的梯度是关于权重的线性函数,并且文献[12]中学习率和动量系数甚至被限制为常数,在这些限制下,BPM 的迭代过程稳定,其收敛性由迭代矩阵的特征值决定。但是,对于一般的激活函数比如Sigmoid 函数,损失函数对权重的梯度不是线性函数。文献[13]中针对没有隐藏层的简单网络证明了BPM 的全局收敛性。虽然这些结果对于任意给定的初始权重有效,但没限制损失函数的梯度是线性。……

登录APP查看全文