APP下载

基于3D可扩展PE阵列CNN加速器的设计*

2021-04-06苏梓培陈弟虎

计算机工程与科学 2021年3期
关键词:排序

苏梓培,杨 鑫,陈弟虎,粟 涛

(中山大学电子与信息工程学院,广东 广州 510275)

1 引言

随着科技的日益发展,人们开始着重于对人工智能的研究。在计算机视觉领域,卷积神经网络CNN运用十分广泛,且在各种各样的应用中遍地开花。CNN模型的数据量不断增大,精确度不断提高,同时带来的是模型的复杂化,计算量的剧增。而在一些特别的移动端的应用需求(如无人驾驶)中,对于数据量巨大的CNN网络,需要十分快速的前馈计算来满足需求,因此研究CNN加速器显得十分必要。

现在有许多研究CNN加速器的工作,而随着CNN的发展,层数越来越多,数据量越来越大,卷积操作越来越复杂,使得神经网络的计算无法简单地映射到直接对应的硬件上,要考虑到各种硬件部件的复用。运算的基本单位为一个 PE(Processing Element),而不同的 PE 也对应着不同的架构:有的PE是一个乘加器,如文献[1,2],通过 PE 间数据传输进行数据复用;有的 PE 是多个乘加器与加法树的组合,如文献[3,4];也有的 PE 除了乘加器,还包括数据传输与 FIFO,如文献[5,6]。

但是,不同的应用场景对加速器的具体需求不一样。应用的场景不同,硬件资源约束不同,使用网络也不同,因此需要能够快速寻找并快速设计性能较优的CNN加速器。且现有移动端所使用的网络层数偏中。而MobileNet中提出的深度可分离卷积的运用也越来越多,因此需要适配DW(Depthwise)/PW(Pointwise)/CONV(Convolution)的加速器架构。文献[7,8]设计了专门用于深度可分离卷积的神经网络,但这些神经网络不能兼容经典的卷积。

针对上述问题,本文提出了一个基于3D可扩展PE阵列的CNN加速器,能够很好地根据不同的网络和硬件资源进行适配,并根据约束找到最优的3D-PE每一维的PE数量。……

登录APP查看全文

猜你喜欢

排序
排排序
作者简介
作者简介
作者简介(按文章先后排序)
恐怖排序
律句填空排序题的备考策略
节日排序
刻舟求剑
作者简介(按文章先后排序)
2010年