基于AI神经网络加速芯片的模型量化算法
2021-03-14王骞陶青川
现代计算机 2021年36期
关键词:模型
王骞,陶青川
(四川大学电子信息学院,成都 610065)
0 引言
近年来,由于深度学习技术的蓬勃发展,深度卷积神经网络也被大量地运用于生活中的各种场景,例如人脸识别、人脸检测、异常检测、姿态估计,等等。尽管其应用广泛,但是其庞大的计算量和内存占用始终是深度神经网络无法全面落地的一个重要原因。很多大型深度卷积神经网络的精度非常高,但往往伴随着庞大的参数量和计算量,例如VGG[6],ResNet[5],MobileNetV3[7],ShuffleNet[8],等等。但是他们的权重模型参数巨大,从几十MB 到几个GB 不等,这使得这项技术很难在需求更加广泛的边缘计算设备上运用。众所周知,边缘计算设备是严重的计算和内存资源受限的,比如常用的嵌入式开发板,其普通的芯片算力可能只有几个GFLOPs,而上述所说的网络模型少则几个GFLOPs 的计算量,多则几十、几百GFLOPs 甚至几个TFLOPs 的计算量,而大多数应用场景又要求能够实时的计算,所以原本的网络模型根本无法在边缘嵌入式设备上进行模型部署。
针对上述问题,工业界和学术界都在努力解决,都在尽可能地将网络模型缩小,降低模型前向推理时的计算量和内存占用,并且也取得了相当不错的成果。目前主流的方法有四种:①设计轻量化的网络结构,比如使用于手机端的Mo⁃bileNet系列、ShuffleNet系列都是轻量化设计的典范,其中设计的深度可分离卷积和分组卷积效果很好,其性能在配合手机端的GPU 时非常不错。②模型剪枝[10],其基本方法是将训练好的浮点模型中的神经元根据信息量大小进行屏蔽,将网络稀疏化,达到降低内存开销,加速推理过程,剪枝方法包括结构化剪枝和非结构化剪枝。……
登录APP查看全文
