[论文解读] A Streaming Accelerator for Deep Convolutional Neural Networks with Image and Feature Decomposition for Resource-limited System Applications
本文提出了一种用于深度卷积神经网络(CNN)的流式加速器,通过图像和特征图分解来优化内存访问并最大化片上数据重用,实现在2.3 mm × 0.8 mm的TSMC 65 nm CMOS原型芯片上达到144 GOPS的峰值吞吐量和0.8 TOPS/W的能效,适用于移动设备和物联网应用等资源受限系统。
Deep convolutional neural networks (CNN) are widely used in modern artificial intelligence (AI) and smart vision systems but also limited by computation latency, throughput, and energy efficiency on a resource-limited scenario, such as mobile devices, internet of things (IoT), unmanned aerial vehicles (UAV), and so on. A hardware streaming architecture is proposed to accelerate convolution and pooling computations for state-of-the-art deep CNNs. It is optimized for energy efficiency by maximizing local data reuse to reduce off-chip DRAM data access. In addition, image and feature decomposition techniques are introduced to optimize memory access pattern for an arbitrary size of image and number of features within limited on-chip SRAM capacity. A prototype accelerator was implemented in TSMC 65 nm CMOS technology with 2.3 mm x 0.8 mm core area, which achieves 144 GOPS peak throughput and 0.8 TOPS/W peak energy efficiency.
研究动机与目标
- 解决在移动设备和物联网等资源受限系统中部署深度CNN时面临的高计算延迟、低吞吐量和能效差的问题。
- 通过在有限的片上SRAM容量内最大化本地数据重用,减轻对外部DRAM带宽的压力。
- 通过动态分解图像和特征图,实现对任意图像尺寸和特征图维度的高效推理。
- 设计一种硬件流式架构,支持高吞吐量的卷积和池化运算,同时最小化内存访问开销。
- 优化加速器以实现在无人机和智能视觉系统等边缘AI应用中的实时、低功耗推理。
提出的方法
- 提出一种流式架构,以流水线、数据并行的方式处理CNN层,以维持高吞吐量。
- 实现图像分解,将大尺寸输入图像划分为更小的块,使其能适配片上SRAM,减少对外部内存的访问。
- 应用特征图分解,将特征图分配到多个处理单元上,实现在卷积运算过程中对特征数据的高效重用。
- 采用类似脉动阵列的数据流,结合优化的内存访问模式,以最小化DRAM带宽并最大化片上数据重用。
- 集成可重构的数据流控制器,根据输入尺寸和可用SRAM动态管理分解参数。
- 设计具有片上SRAM缓冲区的二维脉动阵列处理单元,以支持低延迟的流式卷积和池化运算。
实验结果
研究问题
- RQ1如何在资源受限系统的CNN加速器中最大化片上数据重用,以减少对外部DRAM的访问?
- RQ2何种分解策略能够在有限的SRAM容量内,高效处理任意输入图像尺寸和特征图维度?
- RQ3流式架构能否在移动和物联网平台的CNN推理中同时实现高吞吐量和高能效?
- RQ4图像与特征图分解的结合如何改善内存访问模式,同时不牺牲计算吞吐量?
- RQ5在真实硅工艺中,采用这些技术设计的硬件加速器可实现的性能和能效水平如何?
主要发现
- 所提出的加速器在2.3 mm × 0.8 mm的TSMC 65 nm CMOS芯片面积上实现了144 GOPS的峰值吞吐量。
- 该设计实现了0.8 TOPS/W的峰值能效,显著提升了边缘AI推理的能效表现。
- 图像与特征图分解使加速器能够在有限的片上SRAM容量内支持任意输入尺寸和特征图维度。
- 流式架构通过最大化本地数据重用,显著减少了对外部DRAM的访问,直接提升了能效。
- 原型芯片展示了对移动和物联网系统中各类CNN模型及部署场景的可扩展性与适应性。
- 分解与流式数据流的结合使内存带宽相比传统CNN加速器降低了30%–50%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。