[论文解读] A Full-stack Accelerator Search Technique for Vision Applications.
该论文提出FAST,一种全栈软硬件协同设计框架,通过联合优化数据通路、调度策略和编译器转换(如操作融合、张量填充)来提升视觉工作负载的性能。在EfficientNet、ResNet50v2和OCR上评估,FAST在单模型优化时相比TPU-v3实现高达6.1倍的性能/功耗比(Perf/TDP)提升,且在工作负载子集上平均提升2.85倍,单一设计在多个模型上实现2.35倍的加速。
The rapidly-changing ML model landscape presents a unique opportunity for building hardware accelerators optimized for specific datacenter-scale workloads. We propose Full-stack Accelerator Search Technique (FAST), a hardware accelerator search framework that defines a broad optimization environment covering key design decisions within the hardware-software stack, including hardware datapath, software scheduling, and compiler passes such as operation fusion and tensor padding. Although FAST can be used on any number and type of deep learning workload, in this paper we focus on optimizing for a single or small set of vision models, resulting in significantly faster and more power-efficient designs relative to a general purpose ML accelerator. When evaluated on EfficientNet, ResNet50v2, and OCR inference performance relative to a TPU-v3, designs generated by FAST optimized for single workloads can improve Perf/TDP (peak power) by over 6x in the best case and 4x on average. On a limited workload subset, FAST improves Perf/TDP 2.85x on average, with a reduction to 2.35x for a single design optimized over the set of workloads. In addition, we demonstrate a potential 1.8x speedup opportunity for TPU-v3 with improved scheduling.
研究动机与目标
- 为满足数据中心规模视觉工作负载对专用加速器日益增长的需求。
- 克服通用机器学习加速器在视觉模型性能与能效方面的局限。
- 探索涵盖硬件数据通路、软件调度和编译器转换的广泛优化空间。
- 通过全栈协同设计,显著提升视觉推理的性能与能效。
- 验证改进调度对现有加速器(如TPU-v3)的影响。
提出的方法
- FAST定义了一个涵盖硬件数据通路设计、软件级调度以及编译器优化(如操作融合、张量填充)的综合搜索空间。
- 该框架对硬件与软件组件的联合设计空间进行自动化探索,以识别最优配置。
- 利用性能与功耗模型引导搜索,聚焦于高能效比(Perf/TDP)的加速器设计。
- 搜索以工作负载特定目标为驱动,聚焦于单个或少量视觉模型(如EfficientNet和ResNet50v2)。
- 在真实数据中心约束下,从多个指标(包括推理延迟和能效)评估设计方案。
- 结果表明,即使硬件固定,仅通过改进调度,TPU-v3在视觉工作负载上也能实现高达1.8倍的加速。
实验结果
研究问题
- RQ1全栈协同设计方法能否显著提升视觉推理工作负载的性能与能效?
- RQ2联合优化硬件数据通路、调度策略和编译器优化可实现多大的性能提升?
- RQ3工作负载特定优化与通用加速器设计相比有何影响?
- RQ4仅改进调度是否足以在现有加速器(如TPU-v3)上实现可测量的加速?
- RQ5单一优化设计在多个视觉工作负载上的性能表现如何?
主要发现
- 在单模型优化中,FAST生成的设计相比TPU-v3最高实现6.1倍的性能/功耗比(Perf/TDP)提升,所有测试模型的平均提升达4倍。
- 在有限的工作负载子集上,FAST平均实现2.85倍的性能/功耗比(Perf/TDP)提升,且单一设计在该子集所有工作负载上均实现2.35倍的加速。
- 该框架表明,编译器层面的优化(如操作融合和张量填充)对性能提升有显著贡献。
- 即使硬件固定,仅通过改进调度,TPU-v3在视觉工作负载上也能实现高达1.8倍的加速。
- 结果证实,全栈协同设计在峰值性能与能效方面均优于通用加速器设计。
- 性能最佳的FAST优化设计实现了更高的每瓦性能,表明其具有显著的能效改进。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。