Skip to main content
QUICK REVIEW

[论文解读] Design Flow of Accelerating Hybrid Extremely Low Bit-width Neural Network in Embedded FPGA

Junsong Wang, Qiuwen Lou|arXiv (Cornell University)|Jul 31, 2018
Advanced Neural Network Applications参考文献 21被引用 5
一句话总结

该论文提出了一种针对嵌入式FPGA上混合极低比特宽度神经网络(ELB-NNs)的加速设计流程,采用灵活的、逐层定制的权重量化与激活量化方法。端到端自动化工具AccELB无需RTL编码即可生成优化的FPGA实现,最高达到10.3 TOPS的性能和每瓦325.3张图像/秒的能效,优于GPU及先前的FPGA解决方案,在能效方面表现更优。

ABSTRACT

Neural network accelerators with low latency and low energy consumption are desirable for edge computing. To create such accelerators, we propose a design flow for accelerating the extremely low bit-width neural network (ELB-NN) in embedded FPGAs with hybrid quantization schemes. This flow covers both network training and FPGA-based network deployment, which facilitates the design space exploration and simplifies the tradeoff between network accuracy and computation efficiency. Using this flow helps hardware designers to deliver a network accelerator in edge devices under strict resource and power constraints. We present the proposed flow by supporting hybrid ELB settings within a neural network. Results show that our design can deliver very high performance peaking at 10.3 TOPS and classify up to 325.3 image/s/watt while running large-scale neural networks for less than 5W using embedded FPGA. To the best of our knowledge, it is the most energy efficient solution in comparison to GPU or other FPGA implementations reported so far in the literature.

研究动机与目标

  • 解决在功耗和面积预算严格受限的边缘设备上部署大规模、能效受限的DNN模型的挑战。
  • 实现灵活的、逐层的权重量化与激活量化,以在精度、延迟与能效之间取得平衡。
  • 开发端到端的自动化流水线,消除手动RTL编程,简化混合ELB-NN在FPGA上的部署流程。
  • 在低精度推理方面,实现优于GPU及先前基于FPGA的DNN加速器的卓越能效表现。

提出的方法

  • 提出一种混合量化方案,允许在层间及层内对权重和激活使用不同的位宽(如2位、4位、8位)。
  • 设计一种流水线化、高吞吐量的推理架构,以适配混合ELB-NN对异构精度的需求。
  • 实现基于Caffe的训练框架,支持在混合精度设置下进行高精度、低精度模型训练。
  • 开发AccELB工具,将Caffe prototxt映射为优化的高性能FPGA RTL,利用预优化库实现。
  • 集成内存层次结构,以管理大型模型(如VGG16)的片外内存访问,即使权重已二值化也能支持。
  • 采用Xilinx ZC706 FPGA开发板进行评估,通过数字功率计测量功耗,确保能效报告的准确性。

实验结果

研究问题

  • RQ1在FPGA上,混合量化方案(在层间及层内变化位宽)如何改善ELB-NN在精度与效率之间的权衡?
  • RQ2在嵌入式FPGA加速器中,混合精度权重与激活的最优配置是什么,可最大化能效?
  • RQ3自动化工具链是否能消除对低层RTL编程的依赖,同时仍实现高性能与高能效?
  • RQ4所提出的基于FPGA的ELB-NN加速器在能效方面与最先进的GPU及FPGA解决方案相比如何?
  • RQ5在资源受限的嵌入式FPGA上部署大规模ELB-NN(如VGG16)时,其性能与功耗特性如何?

主要发现

  • 所提出的方案在嵌入式FPGA上实现了10.3 TOPS的峰值性能,展示了对大规模ELB-NN的高计算吞吐能力。
  • 在4-8218混合量化设置下,AlexNet的能效达到每瓦325.3张图像/秒,相比边缘设备(TX2)和数据中心(P4)GPU最高提升3.9倍。
  • AccELB自动化工具实现了无需RTL编码的FPGA部署,显著降低了设计时间和复杂度。
  • 该实现的LUT效率(每千个LUT的GOPs)比同类高端FPGA解决方案高出2倍,且优于最高效先前工作的13%。
  • 即使精度略低(AccELB(1)为49.3%,INT8 GPU为54.6%),所提方案在低批处理大小下仍保持显著的能效优势。
  • 通过引入内存层次结构,该设计支持大型模型(如VGG16),克服了即使在权重二值化情况下片上内存的限制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。