[论文解读] A Survey and Empirical Evaluation of Parallel Deep Learning Frameworks
本文综述并实证评估了主流的并行深度学习框架,对比了视觉和语言任务中数据并行、层内并行和层间并行的性能。研究发现,数据并行在统计效率和可扩展性方面表现更优,ZeRO在不损失性能的前提下将显存减少42–66%,而混合方法(如Megatron + 数据并行)在高GPU数量下对大模型训练最为理想。
The field of deep learning has witnessed a remarkable shift towards extremely compute- and memory-intensive neural networks. These newer larger models have enabled researchers to advance state-of-the-art tools across a variety of fields. This phenomenon has spurred the development of algorithms for distributed training of neural networks over a larger number of hardware accelerators. In this paper, we discuss and compare current state-of-the-art frameworks for large scale distributed deep learning. First, we survey current practices in distributed learning and identify the different types of parallelism used. Then, we present empirical results comparing their performance on large image and language training tasks. Additionally, we address their statistical efficiency and memory consumption behavior. Based on our results, we discuss algorithmic and implementation portions of each framework which hinder performance.
研究动机与目标
- 提供当前最先进的分布式深度学习框架及其并行化策略的全面综述。
- 在大规模图像和语言训练任务上实证评估开源框架,对比运行时间、显存消耗和统计效率。
- 识别阻碍现代深度学习框架性能的算法与实现瓶颈。
- 为研究人员和实践者在模型大小、硬件约束和训练效率目标下选择最优框架提供建议。
提出的方法
- 将并行化策略分类为三类:数据并行、层内(模型)并行和层间(流水线)并行。
- 选取并基准测试了六个开源框架:DDP、PipeDream、ZeRO、Megatron、TorchGPipe 和 LBANN,分别在配备 A100 和 V100 GPU 的两个集群上进行测试。
- 测量了多个 GPU 数量下的训练周期执行时间、统计效率(通过验证准确率/困惑度随时间的变化)以及每 GPU 的显存使用量。
- 采用标准基准:在 ImageNet 上使用 VGG-16 和在语言建模数据集上使用 GPT2-medium,以评估可扩展性和收敛性。
- 分析了数据并行中有效批量大小增加的影响,以及流水线框架中权重延迟的影响。
- 绘制验证指标随训练时间的变化曲线,以综合评估性能和统计效率,避免仅依赖周期数作为衡量标准。
实验结果
研究问题
- RQ1不同并行化策略(数据并行、层内并行、层间并行)在训练速度、显存使用和统计效率方面如何比较?
- RQ2增加 GPU 数量对各框架的性能和显存消耗有何影响?
- RQ3权重延迟和梯度同步机制如何影响流水线框架中的收敛速度和统计效率?
- RQ4如 ZeRO 等显存优化技术在不牺牲训练速度的前提下,能将 GPU 显存占用减少多少?
- RQ5在高 GPU 数量系统上,何种混合策略(如结合层内并行和数据并行)最适合大模型训练?
主要发现
- 数据并行框架(DDP、ZeRO、LBANN)实现了最高的统计效率,其验证曲线几乎完全一致,且收敛速度优于流水线方法。
- PipeDream 因未缓解的权重延迟导致收敛速度显著变慢,即使采用了权重缓存技术,仍难以胜任大规模训练。
- 与 DDP 相比,ZeRO 将每 GPU 显存使用量减少了 42–66%,且随着 GPU 数量增加,显存节省效果更显著,同时未影响训练速度。
- 在语言任务中,Megatron-intra 的统计效率优于数据并行框架,但仅在低 GPU 数量下成立;在大规模场景下,由于有效批量大小持续增加,性能出现下降。
- Megatron 中的 U 型显存曲线是由高 GPU 数量下激活显存持续增加所致,最终抵消了层划分带来的参数显存节省。
- 将层内并行(如 Megatron)与数据并行结合的混合方法,在大模型训练中实现了最优的性能和显存效率,尤其在高 GPU 系统上表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。