[论文解读] Efficient Algorithms for Device Placement of DNN Graph Operators
本文针对推理和训练工作负载中的DNN算子设备放置问题,提出了最优的整数规划(IP)与动态规划(DP)算法,旨在最小化延迟并最大化吞吐量。相较于局部搜索方法提速最高达2.08倍,相较于Scotch提速最高达7.69倍,其解决方案在复杂、内存受限的DNN图上,相较于人工专家启发式方法,延迟降低最高达72%。
Modern machine learning workloads use large models, with complex structures, that are very expensive to execute. The devices that execute complex models are becoming increasingly heterogeneous as we see a flourishing of domain-specific accelerators being offered as hardware accelerators in addition to CPUs. These trends necessitate distributing the workload across multiple devices. Recent work has shown that significant gains can be obtained with model parallelism, i.e, partitioning a neural network's computational graph onto multiple devices. In particular, this form of parallelism assumes a pipeline of devices, which is fed a stream of samples and yields high throughput for training and inference of DNNs. However, for such settings (large models and multiple heterogeneous devices), we require automated algorithms and toolchains that can partition the ML workload across devices. In this paper, we identify and isolate the structured optimization problem at the core of device placement of DNN operators, for both inference and training, especially in modern pipelined settings. We then provide algorithms that solve this problem to optimality. We demonstrate the applicability and efficiency of our approaches using several contemporary DNN computation graphs.
研究动机与目标
- 为应对在异构、内存受限的加速器上部署大规模、复杂DNN模型在推理与训练工作负载中的日益严峻挑战。
- 识别并解决模型并行DNN执行中高效设备放置的核心组合优化问题。
- 为延迟敏感的单流推理与吞吐量优化的流水线训练提供可证明最优的解决方案。
- 支持跨多种设备类型(包括具有不同内存与带宽限制的加速器)的非连续图划分。
- 在严格内存限制下,相较于启发式、人工专家与基线方法,在解的质量与鲁棒性方面均表现更优。
提出的方法
- 将设备放置问题建模为整数规划(IP)模型,联合优化算子划分与调度,以实现单流推理中的延迟最小化。
- 提出一种动态规划(DP)方法,用于流水线训练中的吞吐量最大化,建模数据流与计算与通信的重叠。
- 支持任意DAG结构,包括细粒度算子图,并允许在多个加速器上进行非连续划分。
- 将内存与互连约束直接整合到优化过程中,确保在硬件限制下的可行放置。
- 采用带时间限制的IP求解器并附带最优性间隙认证,以在解的质量与运行时间之间取得平衡,支持实际部署。
- 采用统一框架,适用于训练(模型并行与流水线并行)与推理(单流与离线)场景。
实验结果
研究问题
- RQ1在DNN执行中,能够准确捕捉端到端设备放置与调度权衡的正确组合优化问题是什么?
- RQ2在推理与训练中,如何在内存与通信约束下实现DNN设备放置的可证明最优解?
- RQ3相较于连续或启发式划分,非连续图划分在性能提升方面有多大优势?
- RQ4与人工设计的、贪心的以及最先进基线方法相比,所提方法在延迟与吞吐量方面表现如何?
- RQ5该优化框架能否扩展至具有数十亿参数与复杂算子图的真实世界DNN?
主要发现
- 基于IP的算法在延迟最小化方面,相较于贪心基线方法延迟降低最高达72%,相较于最大负载DP降低42%,表现出更优性能。
- 在性能最佳的工作负载中,IP求解器相较于局部搜索提速2.08倍,相较于Scotch提速7.69倍,而后者在34%的案例中违反了内存约束。
- 在8个任务中的5个中,IP求解器在1小时内未能收敛至最优解,但仍优于所有基线方法,表明其具有强大的实际性能。
- IP求解器在所有工作负载中,7分钟内即找到距离最终值仅2%以内的解,表明早期终止可实现高质量结果。
- 人工专家划分在延迟方面最高被超越23%,且在两起案例中内存占用超过3倍,凸显了手动调优的局限性。
- 该方法在平均上相较专家划分提速1.46倍,相较局部搜索提速1.29倍,且非连续划分始终优于所有其他方案。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。