[论文解读] SWARM Parallelism: Training Large Models Can Be Surprisingly Communication-Efficient
SWARM并行是一种专为不可靠、异构且带宽较低的环境设计的去中心化、容错的模型并行训练算法。它通过随机连接、动态负载均衡的流水线减少通信开销,使在预占中断的T4 GPU上以低于200 Mb/s的网络带宽训练十亿参数的Transformer模型成为可能,通过平方-立方定律和8位量化实现高吞吐量和成本效率。
Many deep learning applications benefit from using large models with billions of parameters. Training these models is notoriously expensive due to the need for specialized HPC clusters. In this work, we consider alternative setups for training large models: using cheap "preemptible" instances or pooling existing resources from multiple regions. We analyze the performance of existing model-parallel algorithms in these conditions and find configurations where training larger models becomes less communication-intensive. Based on these findings, we propose SWARM parallelism, a model-parallel training algorithm designed for poorly connected, heterogeneous and unreliable devices. SWARM creates temporary randomized pipelines between nodes that are rebalanced in case of failure. We empirically validate our findings and compare SWARM parallelism with existing large-scale training approaches. Finally, we combine our insights with compression strategies to train a large Transformer language model with 1B shared parameters (approximately 13B before sharing) on preemptible T4 GPUs with less than 200Mb/s network.
研究动机与目标
- 在如预占云实例或池化异构资源等成本低廉、不可靠的环境中,实现大规模模型训练。
- 解决现有模型并行算法在处理设备故障、网络不稳定和异构硬件方面的局限性。
- 通过利用平方-立方定律,减少分布式训练中的通信开销,即随着模型增大,单位参数的通信量反而降低。
- 开发一种去中心化、容错的训练框架,能够在低带宽、不可靠设备上扩展至十亿参数模型。
提出的方法
- SWARM并行通过节点间随机、临时的流水线连接实现容错和动态负载均衡。
- 定期重新平衡流水线阶段,以适应不同设备的性能和网络延迟差异。
- 该算法为去中心化设计,避免对中央协调器的依赖,并优先选择稳定、低延迟的通信对等节点。
- 集成8位分块量化技术,将激活值通信量减半,且精度损失可忽略。
- 采用压缩感知架构(如maxout、瓶颈结构)进一步降低带宽需求。
- 利用平方-立方定律,即模型规模增大时,计算量的增长速度超过通信量,从而降低相对通信成本。
实验结果
研究问题
- RQ1在流水线并行设置中,训练更大模型是否能降低相对通信开销,从而违背传统直觉?
- RQ2在去中心化、异构环境中,如何使模型并行训练对设备故障和网络不可靠具备鲁棒性?
- RQ3在不牺牲训练吞吐量或模型质量的前提下,通信带宽最多可降低多少?
- RQ4SWARM并行是否能在带宽低于200 Mb/s的低成本、预占中断GPU上实现高训练效率?
- RQ5SWARM并行、压缩技术与平方-立方定律的结合,如何实现十亿参数模型的成本有效训练?
主要发现
- SWARM并行可在预占中断的T4 GPU上以低于200 Mb/s的网络带宽训练一个10亿参数的共享参数Transformer模型。
- 该算法实现了与标准同步数据并行训练相当的训练吞吐量,收敛曲线在随机种子波动范围内一致。
- 采用8位量化将激活通信量减少两倍,且精度损失极小。
- 在32个预占中断的T4 GPU上训练ALBERT-Large模型的总成本为497.80美元,比在可靠V100上低64%。
- 平方-立方定律使更大模型的相对通信成本更低,从而让低带宽环境具备可行性。
- 压缩感知架构(如maxout)进一步降低了带宽需求,尤其在高比例压缩下,且未损害分布内或分布外性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。