融合先验知识的深度学习模型快速训练方法
2021-05-08王鹏鸣何鸣王红滨
哈尔滨工程大学学报 2021年4期
关键词:模型
王鹏鸣,何鸣,王红滨
(1.哈尔滨工程大学 计算机科学与技术学院,黑龙江 哈尔滨 150001;2.黑龙江科技大学 计算机与信息工程学院,黑龙江 哈尔滨 150022)
深度学习广泛用于处理模式识别问题的实际场景,并且向着结构更深、规模更大、设计更精巧的方向发展,由此带来越来越多的模型参数及越来越长的模型训练时间。深度学习的模型训练过程是一个复杂的、需要综合考量的问题,其优化过程涉及到参数、结构以及方法等各个方面。有研究人员从不同的解读角度入手,提出了不同的解决方法,但这些方面多与模型结构相关,存在无法泛化的弊端。研究证明,传统的深度学习的模型训练过程之所以耗费大量的训练时间,其原因在于模型因寻找全局最优解的过程中陷入到的低学习率区域。与传统的训练方法相比,使用先验知识的引导,可以认为神经网络已知了一个或多个可以通往全局最优解的方向,这类方向的数量由先验知识的数量决定。而在实际应用中,损失平面上鞍点的数量远大于局部极小值区域的数量,正是由于在鞍点处可以存在数十亿个可能的梯度下降方向[1],所以能否尽快的寻找到一条通往全局最优解的方向将决定神经网络训练速度的快慢。近几年,由于应用的需求,如何解决模型的优化问题逐渐成为研究模型解释性与模型优化方法的研究重点之一。
HINTON等[2]提出了深度神经网络的概念。神经网络的训练过程优化方法通常采用更平均的初始化参数、更快的梯度下降算法或更精炼的网络结构来实现的。……
登录APP查看全文
