卷积神经网络压缩与加速技术研究进展①
2020-09-22尹文枫梁玲燕彭慧民曹其春赵雅倩
计算机系统应用 2020年9期
尹文枫,梁玲燕,彭慧民,曹其春,赵 健,董 刚,赵雅倩,赵 坤
1(浪潮电子信息产业股份有限公司,济南 250101)
2(广东浪潮大数据研究有限公司,广州 510632)
随着硬件的发展,如图形处理单元(GPU)[1]和张量处理单元(TPU)[2],以及深度学习算法的成功,如AlexNet[3]、16 层VGG[4]和152 层ResNet[5],基于深度学习的应用在计算机视觉、语音识别和推荐系统等广泛领域得到普及.这些强大的深度学习模型伴随着在延迟、存储、算力和能耗等方面的资源开销增加,给资源有限的移动和嵌入设备实现离线深度感知带来了困难.性能良好的VGG-16 模型[4]采用8 比特量化之后,由ImageNet数据集[6]训练,需要1 .5×1010次 乘法累加操作,1.4×108个参数,1650 ms 的平均延迟,在RedMi 3S Android平台上能耗为397.7 mJ[7].因此,压缩神经网络的参数和计算,有助于将一些典型的基于深度学习算法的应用如语音助手、人脸识别、指纹解锁和文本处理工具等部署在移动平台.
本文将对模型压缩技术中的代表方法进行介绍与分析.但是,诸如MobileNet、Inception、SqueezeNet等采用紧致的卷积核或高效的计算方式来搭建深度神经网络的轻量化模型设计方法不在本文讨论范围内.不同于在预训练网络上进行处理,轻量化模型设计方法另辟蹊径.轻量化模型设计方法采用紧致的卷积核或高效的计算方式来搭建深度神经网络,而不是由预训练神经网络进行神经元或神经元连接的删减来实现模型压缩.
1 神经网络模型与压缩工具
本节主要介绍经典的神经网络模型,这些代表性模型通常应用于评测新兴压缩方法的……
登录APP查看全文
