Skip to main content
QUICK REVIEW

[论文解读] Learned Hardware/Software Co-Design of Neural Accelerators

Zhan Shi, Chirag Sakhuja|arXiv (Cornell University)|Oct 5, 2020
Advanced Neural Network Applications参考文献 41被引用 8
一句话总结

该论文提出了一种约束贝叶斯优化框架,用于神经加速器的联合硬件/软件协同设计,自动探索硬件架构与软件映射的庞大且半离散的设计空间,以最小化能延时积(EDP)。在包括ResNet和DQN在内的多个模型上,该方法相比手工调优的最先进系统,能将能延时积降低18%至40%。

ABSTRACT

The use of deep learning has grown at an exponential rate, giving rise to numerous specialized hardware and software systems for deep learning. Because the design space of deep learning software stacks and hardware accelerators is diverse and vast, prior work considers software optimizations separately from hardware architectures, effectively reducing the search space. Unfortunately, this bifurcated approach means that many profitable design points are never explored. This paper instead casts the problem as hardware/software co-design, with the goal of automatically identifying desirable points in the joint design space. The key to our solution is a new constrained Bayesian optimization framework that avoids invalid solutions by exploiting the highly constrained features of this design space, which are semi-continuous/semi-discrete. We evaluate our optimization framework by applying it to a variety of neural models, improving the energy-delay product by 18% (ResNet) and 40% (DQN) over hand-tuned state-of-the-art systems, as well as demonstrating strong results on other neural network architectures, such as MLPs and Transformers.

研究动机与目标

  • 为解决传统硬件与软件分治优化方法的局限性,这些方法无法探索具有收益的联合设计点。
  • 实现对DNN加速器硬件与软件配置高度受限的半连续/半离散设计空间的自动化、系统化探索。
  • 开发一种可扩展、基于原理的优化框架,联合设计硬件加速器与软件映射,以改善能延时积(EDP)。
  • 证明学习型协同设计能够生成新颖的高性能架构,并在多种神经网络模型上超越基于启发式的优化器。

提出的方法

  • 使用参数化配置形式化描述硬件与软件设计空间,包括PE阵列布局、缓冲区大小、循环分块以及数据流模式。
  • 提出一种嵌套的双层贝叶斯优化框架:外层优化硬件架构,内层为给定架构优化软件映射。
  • 采用约束贝叶斯优化,结合代理模型与采集函数(如LCB),高效导航设计空间,同时避免不可行解。
  • 采用约束形式化方法,考虑硬性约束(如面积、能耗预算及评估前未知的可行性),将无效设计点比例降低超过90%。
  • 利用机器学习建模性能(如延迟、能耗),并引导搜索朝向高性能且可行的配置。
  • 将方法扩展为模块化与可扩展形式,适用于不同DNN架构,包括CNN、MLP和Transformer。

实验结果

研究问题

  • RQ1联合的、自动化的硬件/软件协同设计框架是否能超越传统分步优化硬件与软件的方法?
  • RQ2贝叶斯优化如何适配神经加速器配置的半离散、高度受限的设计空间?
  • RQ3与手工调优的最先进系统相比,端到端协同设计在能延时积方面能实现多大程度的性能提升?
  • RQ4所提出的框架能否发现新颖的、非直观的硬件与软件配置,从而提升效率?
  • RQ5该协同设计方法在包括ResNet、DQN、MLP和Transformer在内的多样化神经网络架构上是否具备鲁棒性?

主要发现

  • 所提出的约束贝叶斯优化框架在DQN上相比手工调优的最先进系统,将能延时积降低了40.2%,在ResNet上降低了18%。
  • 该框架将探索的无效设计点数量减少了超过90%,显著提升了在高度受限设计空间中的搜索效率。
  • 学习型协同设计方法发现了新颖的硬件配置,如优化的PE阵列形状与缓冲区利用策略,其性能优于现有设计(如Eyeriss)。
  • 当将学习得到的硬件配置与启发式软件优化器(如Timeloop)结合使用时,其性能优于优化器自身可找到的结果,证明了其在不同架构上的鲁棒性。
  • 该方法在多种模型(包括MLP和Transformer)上均表现出色,证实其可扩展性不仅限于CNN。
  • 使用代理模型与LCB等采集函数,实现了对联合设计空间的高效、可扩展探索,即使在仿真成本昂贵的情况下亦成立。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。