[论文解读] Co-Design of Deep Neural Nets and Neural Net Accelerators for Embedded Vision Applications
本文提出了一种面向嵌入式视觉应用的深度神经网络(DNN)与神经网络加速器协同设计方法,通过联合优化DNN架构(SqueezeNext)与加速器微架构(Squeezelerator),实现了最高6.3倍的加速比和2.25倍的能耗降低。该方法结合了数据流感知的DNN设计与硬件感知的层重排,以最大化硬件利用率并最小化内存访问开销。
Deep Learning is arguably the most rapidly evolving research area in recent years. As a result it is not surprising that the design of state-of-the-art deep neural net models proceeds without much consideration of the latest hardware targets, and the design of neural net accelerators proceeds without much consideration of the characteristics of the latest deep neural net models. Nevertheless, in this paper we show that there are significant improvements available if deep neural net models and neural net accelerators are co-designed.
研究动机与目标
- 为解决当前最先进的DNN模型与神经网络加速器设计之间日益扩大的脱节问题,这些设计通常被孤立评估。
- 证明协同设计DNN与加速器可在嵌入式视觉工作负载中带来显著的性能、能耗与精度提升。
- 开发一种系统化方法,将硬件约束整合到DNN架构设计中,反之亦然。
- 设计一款专用加速器(Squeezelerator),支持多种数据流(如权重重心与输出重心)以实现逐层最优性能。
- 设计一种新型DNN系列(SqueezeNext),明确针对Squeezelerator的微架构特性进行优化。
提出的方法
- 通过架构仿真与DNN设计之间的反馈回路,实现DNN与加速器的协同设计,重点关注硬件利用率与内存访问模式。
- 设计Squeezelerator加速器,支持按层粒度的权重重心与输出重心数据流,实现对层特征的动态适应。
- 通过将SqueezeNet v1.0的初始层滤波器尺寸从7×7减小到5×5,并重新组织层分布,实现SqueezeNet到SqueezeNext的优化。
- 减少早期层的通道数,并将层重新分配至后期阶段以提高每周期乘加操作数(MACs/cycle),从而提升处理元素(PE)利用率并隐藏内存延迟。
- 通过将寄存器文件大小从8加倍至16,对Squeezelerator进行精细化调优,以增强局部数据重用并减少对外部内存的访问。
- 在Squeezelerator与参考架构上,对多种DNN(SqueezeNet、Tiny Darknet、MobileNet、SqueezeNext)的性能、能耗与精度进行评估。
实验结果
研究问题
- RQ1协同设计DNN与加速器是否能在嵌入式视觉应用中实现可测量的推理速度与能效提升?
- RQ2DNN层中的硬件利用率模式如何影响加速器设计选择,特别是针对小型高效模型?
- RQ3在不牺牲精度的前提下,DNN架构的修改(如滤波器尺寸与层分布)能在多大程度上提升加速器效率?
- RQ4单个加速器是否能够支持每层的多种数据流(如权重重心与输出重心),以适应不同的层特征?
- RQ5寄存器文件大小与数据重用优化对整体系统性能与能耗消耗有何影响?
主要发现
- Squeezelerator加速器在主流DNN上相比单数据流加速器实现了1.1×至6.35×的加速比,且在各类不同类型的层中均实现了更高的硬件利用率。
- 专为Squeezelerator设计的SqueezeNext相比SqueezeNet v1.0实现了2.59倍更快的推理速度与2.25倍更好的能效,且top-1精度提升至59.2%(对比SqueezeNet v1.0的57.1%)。
- 与AlexNet相比,该协同设计方法实现了8.26倍更快的推理速度与7.5倍更低的能耗,同时保持或提升了精度。
- 将第一层滤波器尺寸从7×7减小至5×5,并重新组织层分布,显著提升了硬件利用率并减少了推理时间,尤其在大尺寸输入特征图上效果明显。
- 通过将Squeezelerator的寄存器文件大小从8加倍至16,进一步提升了性能,证明了迭代协同设计的价值。
- SqueezeNext系列在精度、能耗与推理时间之间提供了有利的权衡谱,支持根据应用场景选择最优模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。