基于阿当姆斯捷径连接的深度神经网络模型压缩方法*
2021-11-22石剑平
杜 鹏,李 超,石剑平,姜 麟
(昆明理工大学理学院,云南 昆明 650500)
1 引言
近期机器学习中监督学习的许多突破都是通过深度神经网络的应用实现的,神经网络的深度是获得这些成功最重要的因素之一。在经典图像分类数据集ImageNet上,2012年,Krizhevsky等人[1]使用深度卷积神经网络—AlexNet将1 000分类的正确率提升至84%,AlexNet取得的突破是前所未有的。在接下来的几年里,主流的网络结构突破方向大致是加深网络。Simonyan等人[2]在2014年使用更深层次的网络架构将分类正确率提升至95%。然而简单地增加网络层数并不意味着能提高网络的学习效果,训练更深层次的网络始终是一个巨大的难题。2015年,Srivastava等人[3]提出Highway Networks,借鉴解决循环神经网络RNN(Recurrent Nerual Network)中的问题而被提出的长短期记忆LSTM(Long Short-Term Memory)结构,在深度神经网络中使用门函数来控制信息在层与层之间的流动,形成一种捷径连接方式,解决了梯度信息回流受阻,网络训练困难的问题。之后He等人[4]提出残差网络ResNet(Residual Nerual Network),利用残差学习机制来解决深度神经网络的可训练问题,模型增加一个恒等映射,并通过捷径连接,将残差构件的输出与输入逐个相加。2017年,Lu等人[5]从微分方程数值解的角度出发,提出线性多步结构LM-architecture(Linear Multi-step architecture),以ResNet为基础模型,构造效率更高的深度神经网络模型LM-ResNet。
寻找合适的捷径连接方式指导深度神经网络的结构设计,并辅以对应的网络权重初始化条件以及训练参数设置,可以解决网络的可训练性问题以及模型的效率提升问题。本文将微分方程数值解法—阿当姆斯Adams法思想,迁移到网络结构的设计中,提出一种基于阿当姆斯法的捷径连接(shortcut connection)方式。……
