[论文解读] Multi-DNN Accelerators for Next-Generation AI Systems
本文提出了一种从单DNN到多DNN加速器设计的范式转变,以应对下一代AI系统日益增长的需求。它引入了协同设计方法、跨DNN近似计算以及优化调度,以在满足各类DNN工作负载个体延迟约束的前提下最大化吞吐量。
As the use of AI-powered applications widens across multiple domains, so do increase the computational demands. Primary driver of AI technology are the deep neural networks (DNNs). When focusing either on cloud-based systems that serve multiple AI queries from different users each with their own DNN model, or on mobile robots and smartphones employing pipelines of various models or parallel DNNs for the concurrent processing of multi-modal data, the next generation of AI systems will have multi-DNN workloads at their core. Large-scale deployment of AI services and integration across mobile and embedded systems require additional breakthroughs in the computer architecture front, with processors that can maintain high performance as the number of DNNs increases while meeting the quality-of-service requirements, giving rise to the topic of multi-DNN accelerator design.
研究动机与目标
- 解决云、移动和嵌入式AI系统中对多DNN高效能、低功耗处理日益增长的需求。
- 克服单DNN加速器在处理具有多样化计算与内存需求的多DNN工作负载时的局限性。
- 设计支持流水线、并行和级联DNN工作负载的加速器,同时满足各DNN的延迟与吞吐量约束。
- 在硬件定制化与灵活性之间取得平衡,以支持不断演进的DNN架构与工作负载。
- 通过模型-硬件协同设计与跨DNN近似技术,实现可扩展、高效的多DNN加速。
提出的方法
- 提出一种以DNN间并行化和针对多DNN工作负载定制的自适应调度策略为核心的新型架构范式。
- 引入跨DNN近似计算,利用共享低秩权重表示和可变精度,在可控精度损失下减少资源使用。
- 采用基于搜索的优化(如ASICNAS)的模型-硬件协同设计,联合探索DNN架构、调度与硬件参数。
- 实施工作负载感知的资源分配,考虑不同DNN之间计算-通信比、内存占用量以及对近似的鲁棒性差异。
- 为流水线和并行DNN开发协同调度机制,以最小化空闲时间并最大化吞吐量。
- 集成软件支持与抽象层,确保在多样化AI应用中的可用性。
实验结果
研究问题
- RQ1如何设计多DNN加速器,以高效处理具有不同内存、计算与精度需求的多样化DNN工作负载?
- RQ2在多DNN系统中,除单DNN的吞吐量与延迟外,关键性能指标与设计权衡是什么?
- RQ3如何利用跨DNN冗余性及对近似的不同鲁棒性,以提升能效与面积利用率?
- RQ4哪些可扩展的协同设计方法能有效应对多个DNN与硬件配置组合的高维设计空间?
- RQ5调度与DNN间并行化在最大化整体吞吐量的同时满足各DNN延迟约束方面发挥什么作用?
主要发现
- 多DNN加速器必须从单DNN优化转向DNN间并行化、调度与跨DNN资源共享,以实现高吞吐量与低延迟。
- 跨DNN近似计算(如共享低秩权重表示)可在可控精度下降下显著提升硬件效率。
- 模型-硬件协同设计(如ASICNAS)在多DNN工作负载中可实现高达2倍的能效提升,且精度下降不足1.6个百分点。
- 由于DNN之间的多重性、差异性与相互依赖性,多DNN加速器的设计空间远比单DNN系统复杂。
- 未来加速器必须在定制化与灵活性之间取得平衡,并配备强大的软件支持,以确保在多样化AI应用中的广泛可用性。
- 近似计算与协同设计是实现在下一代多DNN系统中高性能与高能效的关键使能技术。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。