[论文解读] Synthesizing Optimal Parallelism Placement and Reduction Strategies on Hierarchical Systems for Deep Learning
本文提出 $P^{2}$,一种用于多级GPU系统上深度学习的框架,可合成最优的并行化放置方式与层次感知的规约策略。通过使用结构化矩阵建模并行性,并结合带形式语义的语法引导程序合成,$P^{2}$ 有效降低了通信开销——在69%的情况下,全归约性能最高提升448倍,相比默认实现提速2.04倍——同时,其仿真器对前10名性能的预测准确率达92%。
We present a novel characterization of the mapping of multiple parallelism forms (e.g. data and model parallelism) onto hierarchical accelerator systems that is hierarchy-aware and greatly reduces the space of software-to-hardware mapping. We experimentally verify the substantial effect of these mappings on all-reduce performance (up to 448x). We offer a novel syntax-guided program synthesis framework that is able to decompose reductions over one or more parallelism axes to sequences of collectives in a hierarchy- and mapping-aware way. For 69% of parallelism placements and user requested reductions, our framework synthesizes programs that outperform the default all-reduce implementation when evaluated on different GPU hierarchies (max 2.04x, average 1.27x). We complement our synthesis tool with a simulator exceeding 90% top-10 accuracy, which therefore reduces the need for massive evaluations of synthesis results to determine a small set of optimal programs and mappings.
研究动机与目标
- 为解决分布式深度学习中因多种并行形式(如数据并行与模型并行)在分层硬件上映射不当而导致的高通信开销问题。
- 通过引入基于层次感知的矩阵化映射表示,缩小有效并行化放置与规约策略的搜索空间。
- 开发一种程序合成框架,利用形式语义与领域特定语言(DSL)生成优化的集体通信序列。
- 通过仿真实现准确的性能预测,从而减少对合成程序进行昂贵的全规模评估的需求。
- 证明在复杂并行化组合下,自定义规约策略优于标准全归约,在多种GPU拓扑结构中表现更优。
提出的方法
- 该框架将并行化放置建模为并行化矩阵,将并行轴(如数据、模型)映射到系统层次级别(如机架、服务器、GPU),从而大幅缩小搜索空间。
- 引入一种领域特定语言(DSL)以表达分层规约,其形式语义基于霍尔三元组,确保合成过程中的正确性。
- 采用语法引导的合成过程,从DSL生成集体操作(如AllReduce)序列,形式语义作为指导,确保语义正确性。
- 利用并行化矩阵对可能的规约策略搜索空间进行剪枝,确保不遗漏任何有效程序,同时提升效率。
- 系统包含一个仿真器,通过使用现实的带宽假设,对不同网络层级(NIC、PCIe、NVLink)的通信成本进行建模,以预测性能。
- 合成流水线与XLA和NCCL集成,支持在真实系统上使用标准深度学习工作负载进行评估。
实验结果
研究问题
- RQ1如何在不牺牲表达能力或完备性的情况下,缩小在分层系统上并行化放置的搜索空间?
- RQ2不同并行化映射对多样化GPU系统拓扑结构中全归约性能有何影响?
- RQ3基于形式语义与DSL的方法能否实现高性能、层次感知的规约策略合成,使其优于默认的全归约实现?
- RQ4仿真在多大程度上能准确预测合成规约策略的性能,从而减少对昂贵硬件评估的需求?
- RQ5并行化矩阵建模与语法引导合成的结合,在识别深度学习工作负载最优通信模式方面有多高效?
主要发现
- 单一AllReduce操作的性能因并行化放置方式不同,最高可相差448.5倍,凸显了映射选择对通信效率的决定性影响。
- 在69%的并行化放置中,合成的规约策略优于默认AllReduce实现,最大加速比达2.04倍,平均加速比为1.27倍。
- 仿真器对最佳性能规约策略的前10名预测准确率达92%,显著减少了对全硬件评估的需求。
- 该框架即使在复杂拓扑中也能成功识别近似最优程序,其预测结果与V100和A100 GPU系统上的实验结果高度吻合。
- XLA优化可能干扰仿真准确性,但 $P^{2}$ 仍能正确预测优化程序的性能,例如被简化为单步AllReduce的程序。
- 形式语义与语法引导合成的结合确保了所有生成程序在语义上均有效,无误报或遗漏最优解。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。