Skip to main content
QUICK REVIEW

[论文解读] Towards Ultra-High Performance and Energy Efficiency of Deep Learning Systems: An Algorithm-Hardware Co-Optimization Framework

Yanzhi Wang, Caiwen Ding|arXiv (Cornell University)|Feb 18, 2018
CCD and CMOS Imaging Sensors参考文献 2被引用 14
一句话总结

本文提出了一种面向FPGA上超高速度与高能效深度学习的算法-硬件协同优化框架,采用通用块循环矩阵将计算与存储复杂度分别从O(n²)降低至O(n log n)和O(n),同时保持高精度。该框架在保持相同测试精度下,相较于IBM TrueNorth实现152倍的加速比与71倍的能效增益,相较于基准FPGA实现获得31倍的能效增益,主要得益于片上模型存储与通过深度流水线与批量处理实现的高效硬件映射。

ABSTRACT

Hardware accelerations of deep learning systems have been extensively investigated in industry and academia. The aim of this paper is to achieve ultra-high energy efficiency and performance for hardware implementations of deep neural networks (DNNs). An algorithm-hardware co-optimization framework is developed, which is applicable to different DNN types, sizes, and application scenarios. The algorithm part adopts the general block-circulant matrices to achieve a fine-grained tradeoff between accuracy and compression ratio. It applies to both fully-connected and convolutional layers and contains a mathematically rigorous proof of the effectiveness of the method. The proposed algorithm reduces computational complexity per layer from O($n^2$) to O($n\log n$) and storage complexity from O($n^2$) to O($n$), both for training and inference. The hardware part consists of highly efficient Field Programmable Gate Array (FPGA)-based implementations using effective reconfiguration, batch processing, deep pipelining, resource re-using, and hierarchical control. Experimental results demonstrate that the proposed framework achieves at least 152X speedup and 71X energy efficiency gain compared with IBM TrueNorth processor under the same test accuracy. It achieves at least 31X energy efficiency gain compared with the reference FPGA-based work.

研究动机与目标

  • 为移动与物联网设备等资源受限环境中的深度神经网络(DNN)日益增长的计算与能耗需求提供解决方案。
  • 通过实现对精度-压缩权衡的数学上严谨、细粒度的控制,克服现有模型压缩技术的局限性——如不规则稀疏性、训练复杂度增加以及启发式压缩因子。
  • 通过算法与硬件的联合优化,在FPGA-based DNN加速器中实现超高速度与高能效。
  • 通过大幅减小模型尺寸,实现整个模型在片上存储,从而最小化昂贵的片外内存访问。
  • 开发一种可扩展、可泛化的框架,适用于多种DNN类型、尺寸与应用场景,包括全连接层与卷积层。

提出的方法

  • 该算法使用通用块循环矩阵对全连接层与卷积层进行压缩,实现模型精度与压缩率之间的细粒度权衡。
  • 通过快速傅里叶变换(FFT)与逆快速傅里叶变换(IFFT)重构矩阵乘法,解耦操作以降低复杂度并实现高效的硬件映射。
  • 该框架提供了数学上严谨的证明,表明压缩后的DNN渐近收敛至与原始网络相同的性能。
  • 计算复杂度从O(n²)降低至O(n log n),存储复杂度从O(n²)降低至O(n),适用于训练与推理阶段。
  • 硬件实现采用基于FPGA的加速器,结合深度流水线、批量处理、动态重配置、资源复用与分层控制,以最大化吞吐量与能效。
  • 设计确保整个DNN模型可完整存储于片上块内存中,消除片外内存访问,显著提升能效。

实验结果

研究问题

  • RQ1是否可通过统一的算法方法,在全连接层与卷积层等各类DNN层中同时实现高压缩率与低计算复杂度?
  • RQ2使用块循环矩阵是否能实现对原始DNN性能的数学可证明收敛,同时实现对精度与压缩率的细粒度控制?
  • RQ3通过片上模型存储最小化片外内存访问,FPGA-based硬件加速器是否能实现超高的能效?
  • RQ4算法压缩与硬件协同设计在性能与能效方面,能否显著超越如IBM TrueNorth与基准FPGA实现等现有最先进加速器?
  • RQ5与新兴的模拟与器件级DNN加速器相比,该框架在能效与吞吐量方面表现如何?

主要发现

  • 在相同测试精度下,与IBM TrueNorth相比,该框架实现至少152倍的吞吐量加速比与71倍的能效增益。
  • 相较于基准FPGA实现,能效至少提升31倍,主要得益于完整的片上模型存储与片外内存访问的减少。
  • 该框架实现高达5.14 TOPS/W的能效,显著优于模拟与新兴器件实现(如380.7 GOPS/W、142.9 GOPS/W、1.04 TOPS/W)。
  • 在Cyclone V FPGA上,每张图像处理延迟达11.6ns(约86k FPS),在Kintex-7 FPGA上达4ns/张,甚至超越部分新兴器件技术。
  • 该算法将每层的计算复杂度从O(n²)降低至O(n log n),存储复杂度从O(n²)降低至O(n),在MNIST、SVHN与CIFAR-10数据集上精度损失可忽略。
  • 实验结果表明,MNIST上准确率为92.9%至99.0%,SVHN上为96.2%,CIFAR-10上为80.3%至94.75%,能效范围为659.5至2514 GOPS/W。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。