结合半波高斯量化与交替更新的神经网络压缩方法
2021-05-17张红梅严海兵张向利
计算机工程 2021年5期
张红梅,严海兵,张向利
(桂林电子科技大学广西高校云计算与复杂系统重点实验室,广西桂林 541004)
0 概述
近年来,边缘计算技术发展迅速,而体积普遍庞大且计算复杂的卷积神经网络(Convolution Neural Network,CNN)模型仍难以在实时性要求较高但内存容量受限的边缘设备上部署使用,因此卷积神经网络模型压缩与加速成为了学术界和工业界均重点关注的研究领域。随着卷积神经网络模型压缩与加速研究的不断深入,其中的网络量化方法得到了广泛应用。网络量化的核心思想是使用较少的位(bit)代替原始浮点型(32 bit)参数,进而减少模型存储空间。文献[1]将全精度浮点型参数量化到16 bit 固定长度表示,并在训练过程中使用随机约束技术,从而缩减网络存储和浮点计算次数,但压缩程度不高且浮点计算依旧复杂。文献[2]在模型训练过程中直接将全精度权值量化为+1 或-1 并用1 bit 表示,理论上能把模型压缩至原有的1/32,同时将卷积计算中的乘加运算转换为加减运算,达到加速的目的,但因激活值为全精度,无法大幅度加速网络计算。文献[3]提出BNN 网络,该网络通过把权值和激活值量化为+1 和-1,将原始的卷积计算变成同或和位计数运算,大幅压缩和加速深度网络,但此类简单量化的方式导致了较严重的精度损失。为此,文献[4]提出XNOR-Net 和BWN 两个网络,对权值和激活值分别引入缩放因子,减少量化误差并提高训练精度,但在训练过程中会出现梯度不匹配问题,影响精度的进一步提升。……
登录APP查看全文
