[论文解读] PREMA: A Predictive Multi-task Scheduling Algorithm For Preemptible Neural Processing Units
本文提出 PREMA,一种用于可抢占神经处理单元(NPUs)的预测性多任务调度算法,通过轻量级检查点机制智能抢占低优先级任务,显著提升延迟、吞吐量和 SLA 合规性。相比非抢占基线,其平均归一化预测时间(ANTT)降低至 7.8 倍,SLA 满足率提升 1.4 倍,公平性提升 19.6 倍,且硬件开销可忽略不计。
To amortize cost, cloud vendors providing DNN acceleration as a service to end-users employ consolidation and virtualization to share the underlying resources among multiple DNN service requests. This paper makes a case for a "preemptible" neural processing unit (NPU) and a "predictive" multi-task scheduler to meet the latency demands of high-priority inference while maintaining high throughput. We evaluate both the mechanisms that enable NPUs to be preemptible and the policies that utilize them to meet scheduling objectives. We show that preemptive NPU multi-tasking can achieve an average 7.8x, 1.4x, and 4.8x improvement in latency, throughput, and SLA satisfaction, respectively.
研究动机与目标
- 为应对云环境中机器学习即服务(MLaaS)对低延迟、高吞吐量 DNN 推理日益增长的需求,通过支持可抢占 NPU 实现该目标。
- 设计专为 DNN 工作负载优化的轻量级抢占机制,最大限度减少上下文切换开销。
- 开发一种预测性调度策略(PREMA),在多任务 NPU 环境中平衡延迟、公平性、吞吐量与 SLA 遵循性。
- 评估抢占机制(检查点 vs. 杀死)与调度策略对系统级性能指标的影响。
提出的方法
- 设计三种 NPU 抢占机制——检查点、杀掉和混合模式,评估其对上下文状态大小与抢占延迟的影响。
- 采用轻量级回归模型预测 DNN 推理时间,用于调度决策,实现预测性任务优先级排序。
- 提出一种抢占式、高优先级优先的调度策略,根据预测执行时间动态重排任务顺序。
- 在片上 SRAM 中使用 64 位/任务的上下文追踪结构,32nm 工艺下支持 16 个并发任务仅需 0.01 mm² 面积。
- 实现一种内存管理策略,通过 DMA 将溢出的检查点状态迁移至 CPU 内存,以应对内存超分配问题。
- 使用真实 DNN(如 GoogLeNet、ResNet 等)在不同批处理大小与抢占点下进行性能评估,并引入合成工作负载模型。
实验结果
研究问题
- RQ1能否为 NPU 设计轻量级抢占机制,以支持多任务 DNN 推理中低开销的任务抢占?
- RQ2抢占对 DNN 工作负载中检查点上下文状态大小与整体抢占延迟有何影响?
- RQ3与非抢占或仅基于优先级的调度器相比,预测性调度器在降低延迟、提升吞吐量与 SLA 合规性方面能带来多大程度的改进?
- RQ4在 ANTT、公平性与吞吐量方面,检查点与杀掉抢占任务的相对性能如何?
- RQ5PREMA 调度器在不同工作负载、批处理大小与抢占点下的鲁棒性如何?
主要发现
- 与非抢占的 FCFS 调度相比,PREMA 在平均归一化预测时间(ANTT)上实现 7.8 倍的提升。
- 与基线非抢占调度器相比,该算法使公平性提升 19.6 倍,吞吐量提升 1.4 倍。
- SLA 违规率降低 4.8 倍,表明对服务等级目标具有极强的遵循能力。
- 检查点机制在 ANTT 上优于杀掉机制 87%,在 STP 上提升 24%,公平性提升 77%,且性能开销极低。
- 预测模型与实际推理时间的相关性达 98%,可在无需 oracle 访问的情况下实现准确调度决策。
- 硬件与能耗开销可忽略不计——32nm 工艺下 16 个任务仅需 0.01 mm² SRAM,且因吞吐量提升,能效比相应提高。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。