基于对抗学习和知识蒸馏的神经网络压缩算法
2021-11-12刘金金李清宝李晓楠
计算机工程与应用 2021年21期
刘金金,李清宝,李晓楠
1.战略支援部队信息工程大学,郑州450003
2.数学工程与先进计算国家重点实验室,郑州450003
3.中原工学院 计算机学院,郑州450007
深度神经网络在多种计算机视觉相关的任务中展现出了最优越的性能,例如图像分类[1]、工业视觉检测[2]、姿态估计[3]、行人再识别[4]和人脸识别[5]等。随着配套硬件设备的发展和对卷积神经网络认识的不断加深,研究表明越深的网络能够提取越抽象的语义信息,网络的表示能力越强。然而更深更宽的神经网络将难以收敛,并且会导致反向传播算法中的梯度消失[6-7]。残差网络ResNet[1]和批量归一化(Batch Normalization,BN)[8]能够在一定程度上解决这一问题,但是具有大量参数的深度学习模型需要更大的存储空间和更强的运算单元,无法在移动终端上进行部署和实时推理,从而影响深度学习模型在实际应用中的落地和推广。例如公共区域的视频监控系统多部署在内存有限和计算能力较低的嵌入式设备上,无法实时准确地对视频帧中的多人进行身份识别和行为分析。本研究旨在改善深度学习网络在人脸识别系统中的部署和应用问题。
为了解决这一问题,研究人员采用多种技术压缩网络参数,主要包括量化或二值化、因子分解、网络剪枝和知识蒸馏[9]等。其中知识蒸馏的方法基于教师-学生的策略,旨在训练一个轻量级的学生网络,使学生网络模仿完备的大尺寸的教师网络输出的软目标,达到知识迁移的目的。相较于样本固有的一位有效信息标签,教师网络的输出能够提供“不正确”分类的相对概率,使分类概率具有更大的信息量。……
登录APP查看全文
