面向低延时目标检测的FPGA神经网络加速器设计
2021-08-06郑思杰李杰贺光辉
现代计算机 2021年18期
郑思杰,李杰,贺光辉
(1.上海交通大学电子信息与电气工程学院,上海200240;2.上海航天测控通信研究所,上海201109)
0 引言
随着大量可信数据的积累,以数据为研究基础的深度神经网络在目标检测分类领域获得了巨大成功[1],在智能驾驶和目标追踪等领域得到了广泛应用。然而,随着检测性能的提升,检测网络的层数,参数规模和计算复杂度大幅增加。这对硬件的计算性能和存储开销提出了新的挑战。在实时性要求更高的应用中,传统中央处理器的计算架构无法满足实时计算的需求,需要硬件加速器加速计算,从而降低延时。
图形处理器具有更高吞吐性能[2],但功耗较大甚至达到100 W以上[3]。专用集成电路具有更高的能效,例如寒武纪Cambricon-x[4]芯片只需954 mW就能实现544 GOPS的性能。但专用集成电路研发成本高,研发周期长,实现后难以修改,难以适应快速更新的神经网络算法。而现场可编程门阵列(Field Programmable Gate Array,FPGA)则以其可重构、较高的能效比、较低的开发成本成为神经网络加速器的最佳选择[5-6]。
现有神经网路硬件加速器主要从网络模型和硬件结构设计等方面进行优化设计。定点量化是网络模型设计的常用方法[7],但对YOLO等新颖的复杂深度网络算法而言,过小的位宽量化容易造成较大的性能损失[8]。在硬件设计方面,采用稀疏计算结构的STICKER[9]架构能够支持多种稀疏度的自动匹配,从而实现高能效的电路设计。然而该架构采用编码的结构实现零值过滤,具有较大的分布式存储开销,限制了数据的并行计算。……
登录APP查看全文
