Skip to main content
QUICK REVIEW

[论文解读] Hardware/Software Co-Exploration of Neural Architectures

Weiwen Jiang, Lei Yang|arXiv (Cornell University)|Jul 6, 2019
Advanced Neural Network Applications参考文献 40被引用 16
一句话总结

本文提出了一种用于神经架构搜索(NAS)的软硬件协同探索框架,通过联合优化神经架构与FPGA硬件设计空间,以最大化准确率和硬件效率。通过采用两级(快速与慢速)迭代探索机制——其中快速剪枝在无需完整训练的情况下剔除低效架构,而慢速强化学习则对最优候选架构进行精细化优化——该方法在ImageNet上的吞吐量相比硬件感知NAS提升了35.24%,能效比提升了54.05%,同时保持了相近的准确率。

ABSTRACT

We propose a novel hardware and software co-exploration framework for efficient neural architecture search (NAS). Different from existing hardware-aware NAS which assumes a fixed hardware design and explores the neural architecture search space only, our framework simultaneously explores both the architecture search space and the hardware design space to identify the best neural architecture and hardware pairs that maximize both test accuracy and hardware efficiency. Such a practice greatly opens up the design freedom and pushes forward the Pareto frontier between hardware efficiency and test accuracy for better design tradeoffs. The framework iteratively performs a two-level (fast and slow) exploration. Without lengthy training, the fast exploration can effectively fine-tune hyperparameters and prune inferior architectures in terms of hardware specifications, which significantly accelerates the NAS process. Then, the slow exploration trains candidates on a validation set and updates a controller using the reinforcement learning to maximize the expected accuracy together with the hardware efficiency. Experiments on ImageNet show that our co-exploration NAS can find the neural architectures and associated hardware design with the same accuracy, 35.24% higher throughput, 54.05% higher energy efficiency and 136x reduced search time, compared with the state-of-the-art hardware-aware NAS.

研究动机与目标

  • 解决现有硬件感知NAS的局限性,即固定硬件平台仅探索神经架构空间,导致设计权衡不理想。
  • 实现神经架构与硬件设计空间的联合探索,以扩大设计自由度,并提升准确率与硬件效率之间的Pareto前沿。
  • 通过引入快速轻量级剪枝阶段,评估硬件效率而无需完整训练,从而加速NAS过程。
  • 通过在搜索过程中联合优化时序规范,确保最终模型满足实时性要求(例如10 FPS)。
  • 证明仅模型大小无法保证硬件效率,说明由于硬件映射中的结构敏感性,协同探索具有必要性。

提出的方法

  • 实施两级迭代探索:快速阶段用于快速估计硬件效率并剪枝低效架构,慢速阶段用于完整训练及基于策略梯度的控制器更新。
  • 在快速阶段使用BLAST框架将神经网络划分到多个FPGA上,以实现对吞吐量和能效比等硬件效率指标的精确估计。
  • 在慢速阶段集成强化学习,以最大化结合预期准确率与硬件效率的多目标奖励。
  • 将硬件设计空间视为NAS中的第一类对象,支持针对每种神经架构探索定制化FPGA配置。
  • 支持多种硬件指标(如面积、成本、功耗、可靠性)作为优化目标,评估中重点关注吞吐量与能效比。
  • 通过扩展现有NAS框架,增加硬件协同设计能力,支持与最先进NAS流水线的即插即用式集成。

实验结果

研究问题

  • RQ1联合探索神经架构与硬件设计空间,是否能比顺序式或固定硬件的NAS带来更优的准确率与硬件效率之间的权衡?
  • RQ2在不进行完整训练的情况下,基于硬件效率的快速剪枝是否能显著加速NAS过程,同时保持搜索质量?
  • RQ3协同探索能否识别出满足严格实时性约束(如10 FPS)的架构,而硬件感知NAS则无法实现?
  • RQ4架构结构与硬件效率之间的耦合关系如何影响设计空间探索?该关系是否可被利用以提升搜索结果?
  • RQ5与固定硬件方法相比,开放硬件设计空间在多大程度上扩展了准确率与硬件效率之间的Pareto前沿?

主要发现

  • 该协同探索框架在ImageNet上相比硬件感知NAS实现了35.24%更高的吞吐量和54.05%更高的能效比,同时保持了相近的测试准确率。
  • 在CIFAR-10上使用Xilinx XC7Z015 FPGA时,该协同探索方法(设计C)相比硬件感知NAS模型的顺序优化,实现了16.33%更高的吞吐量和28.80%更高的能效比。
  • 该框架成功识别出满足10 FPS时序约束的模型,而ProxylessNet和MobileNetV2均未能达到该基准。
  • 与人工设计的MobileNetV2相比,该协同探索框架实现了2.33倍更高的吞吐量和1.57倍更高的能效比,仅损失0.47%的top-5准确率。
  • 与ProxylessNet相比,该协同探索框架在保持10 FPS要求的前提下实现了90.53%的top-5准确率(vs. 92.50%),证明在实时系统中实现了更优的权衡。
  • 本研究证实,仅靠模型大小无法预测硬件效率——具有相似大小的架构可能表现出截然不同的硬件效率(例如从1.29%到98.35%),从而证明了协同探索的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。