基于二维Winograd算法的深流水线5×5卷积方法
2021-09-09黄程程董霄霄
黄程程,董霄霄,李 钊
(山东理工大学计算机科学与技术学院,山东淄博255049)
0 引言
卷积神经网络在图像分类、语音识别、目标检测等应用中取得了重大进展[1-3]。其中5×5卷积相较3×3卷积有更大的感受野,可以提取更多的边缘特征,在医学影像处理等领域效果显著,且广泛应用于AlexNet、ZFNet和GoogLeNet等经典模型[1]。近期的许多研究就使用包含5×5卷积的架构取得了较3×3卷积更高的预测准确率[4-6]。
卷积神经网络模型规模庞大,计算复杂度高,需要占用大量硬件资源,因此硬件加速器逐渐被用于加速神经网络的预测阶段。常用的神经网络加速器包括图形处理器(Graphic Processing Units,GPU)、专用集成电路(Application Specific Integrated Circuit,ASIC)和现场可编程逻辑门阵列(Field Programmable Gate Array,FPGA)。得益于高并行度、低能耗和可重构等优点,FPGA成为了目前主流的卷积神经网络硬件加速平台[7-16]。
目前在FPGA上加速卷积神经网络面临的问题有:1)卷积神经网络的大规模密集型计算受到FPGA计算能力(片上数字信号处理器(Digital Signal Processor,DSP)数目)的限制,如何优化算法以降低乘法运算量是提升加速器系统性能的主要问题。2)各类快速算法在降低卷积神经网络乘法运算量的同时通常以提升内存资源占用和存储器带宽占用为代价,FPGA片上硬件资源量的限制将影响加速器系统性能。3)卷积神经网络计算量庞大,高效的数据重用能够降低能耗开销并减小设计面积。
在5×5卷积的乘法运算量方面,文献[7]使用8 bit定点数据量化模型,在2个8 bit权重中插入1个8位的全0数据,组成一个低8位和高8位分别为权重数据、中8位为全0字段的24位新数据,使用1个DSP得出2次乘法运算结果,将传统卷积算法的乘法运算量降低至50.0%。……
