一种超低损失的深度神经网络量化压缩方法∗
2021-11-09代素蓉刘方鑫陈新伟
软件学报 2021年8期
龚 成 ,卢 冶 ,代素蓉 ,刘方鑫 ,陈新伟 ,李 涛,4
1(南开大学 计算机学院,天津 300350)
2(天津市网络和数据安全技术重点实验室(南开大学),天津 300350)
3(工业机器人应用福建省高校工程研究中心(闽江学院),福建 福州 350121)
4(计算机体系结构国家重点实验室(中国科学院 计算技术研究所),北京 100190)
随着深度神经网络(DNN)在多个研究领域取得实质性突破,边缘智能场景下DNN 模型的应用和部署,吸引了研究人员的广泛关注.为了追求更高的推理精度,近年来,DNN 模型的计算规模变得愈加庞大、网络结构愈加复杂且不规则[12]、参数量巨大[3−13],其运行时需要强大的计算能力支持并且极其耗能[3].然而,边缘智能设备的计算资源与存储资源有限,并且对能耗及延迟具有严格的约束.因此,在资源受限的边缘设备上部署庞大而复杂的DNN 模型极具挑战[11].将DNN 模型进行压缩,可以有效减少模型的复杂度,使DNN 模型得以应用于边缘智能计算场景.
DNN 模型压缩的主要目的是:在确保DNN 模型推理精度的前提下,消除冗余的模型参数,减少中间结果并降低网络结构的复杂度,从而得到满足精度要求的精简模型.DNN 量化是DNN 模型压缩的一种重要方法[14],它利用低位宽的参数来表示原始的全精度模型,显著降低DNN 模型的计算复杂度和内存占用,使得DNN 模型能够直接在资源受限的边缘设备上进行部署.当原始的模型被量化到极低的位宽时,模型压缩效果尤为明显[15−18].例如,二值神经网络BNN[15]和三值神经网络TWNs[16]可分别将32 位全精……
登录APP查看全文
