APP下载

深度学习中的预条件动量梯度算法

2021-09-29张亮亮喻高航

关键词:深度优化方法

张亮亮,喻高航

(杭州电子科技大学理学院,浙江 杭州 310018)

0 引 言

深度学习(Deep Learning,DL)[1]在许多实际领域中取得了显著的成功,如图像分类[2]、目标检测[3]和人脸识别[4]等,但在大规模数据集上训练深度神经网络仍然很费时。一阶优化算法是深度学习中广泛使用的方法,如动量梯度算法。常用的动量梯度算法主要有重球法(Heavy Ball Method,HB)[5]和Nesterov加速梯度法(Nesterov’s Accelerated Gradient Method,NAG)[6]。当动量方向为有利方向时,动量梯度算法通常能够加速优化,但是,动量项在迭代过程中积累过多历史梯度信息导致超调,造成迭代过程中的震荡现象[7],在一定程度上阻碍了算法的收敛速度。“比例—积分—微分”优化控制器(Proportional-Integral-Derivative Controller,PID)[8]是一种通过控制系统误差来调整系统的反馈控制方法,可以有效克服超调现象,具有鲁棒性,已广泛应用于无人驾驶和智能机器人等实际控制领域。文献[9]提出一种加速深度神经网络优化的PID算法,在PID控制器与大规模优化算法之间建立联系。实际应用中,PID控制器中的微分项通常采用一阶差分近似,在优化过程中无法有效利用二阶信息。为此,本文采用拟牛顿方程,提出一类预条件动量梯度算法。

1 深度学习优化模型

1.1 经验风险最小化

深度学习中常见的一类学习问题是回归与分类等监督学习问题,提供了包含输入数据和带有标签的训练数据集。对已知样本构成的训练集{(x1,y1),(x2,y2),…,(xn,yn)},监督学习通常需要求解经验风险最小化(Empirical Risk Minimization,ERM)[10]模型:

(1)

通过优化模型参数θ,进而预测未知样本x的标签值y,其中li(θ)是第i个样本关于θ的损失函数,n是样本总数,xi∈Rd是第i个样本的输入特征向量,d是特征向量维数,yi∈R是第i个样本的标签(或目标)。……

登录APP查看全文

猜你喜欢

深度优化方法
超限高层建筑结构设计与优化思考
民用建筑防烟排烟设计优化探讨
关于优化消防安全告知承诺的一些思考
一道优化题的几何解法
深度观察
深度观察
深度观察
用对方法才能瘦
四大方法 教你不再“坐以待病”!
捕鱼