[论文解读] Optimizing Multi-GPU Parallelization Strategies for Deep Learning Training
本文提出一种混合多GPU训练策略,将数据并行(DP)与模型并行(MP)相结合,以克服纯数据并行在大规模训练中因通信开销增加和统计效率下降而导致的可扩展性与效率瓶颈。通过建立分析框架并使用DLPlacer——一种基于混合整数线性规划的最优操作-设备映射工具——该研究证明,混合训练在Inception-V3、GNMT和BigLSTM上分别实现了26.5%、8%和22%的端到端训练加速,优于纯数据并行策略。
Deploying deep learning (DL) models across multiple compute devices to train large and complex models continues to grow in importance because of the demand for faster and more frequent training. Data parallelism (DP) is the most widely used parallelization strategy, but as the number of devices in data parallel training grows, so does the communication overhead between devices. Additionally, a larger aggregate batch size per step leads to statistical efficiency loss, i.e., a larger number of epochs are required to converge to a desired accuracy. These factors affect overall training time and beyond a certain number of devices, the speedup from leveraging DP begins to scale poorly. In addition to DP, each training step can be accelerated by exploiting model parallelism (MP). This work explores hybrid parallelization, where each data parallel worker is comprised of more than one device, across which the model dataflow graph (DFG) is split using MP. We show that at scale, hybrid training will be more effective at minimizing end-to-end training time than exploiting DP alone. We project that for Inception-V3, GNMT, and BigLSTM, the hybrid strategy provides an end-to-end training speedup of at least 26.5%, 8%, and 22% respectively compared to what DP alone can achieve at scale.
研究动机与目标
- 为解决随着GPU数量增加,数据并行训练出现收益递减的问题,特别是由通信开销上升和统计效率下降引起的瓶颈。
- 确定在何种情况下引入模型并行可有效突破纯数据并行可扩展性的极限,从而维持或提升训练吞吐量。
- 构建一个系统化框架,根据模型架构和硬件约束,确定最佳并行策略(DP vs. 混合)。
- 开发DLPlacer,一种基于整数线性规划的工具,用于实现操作在设备间的最优映射,以最大化模型并行的加速效果。
- 通过实证验证,混合并行化在多种深度学习模型上显著减少了端到端训练时间。
提出的方法
- 作者建立了一个分析模型,用于预测数据并行性能下降超过模型并行可实现加速的临界点。
- 通过流水线和层间划分技术,实现了Inception-V3、GNMT和BigLSTM的2路模型并行版本,以支持多GPU上的并发执行。
- 提出DLPlacer,一种基于整数线性规划的公式化方法,用于寻找操作在设备间的最优映射,以最小化通信开销并最大化并行度。
- 框架在不同全局批量大小和设备数量下评估训练时间和收敛性,对比纯DP与混合DP+MP策略的性能。
- 使用真实世界模型和硬件配置进行端到端训练加速预测,并通过Inception-V3上的实测加速结果验证了结果的有效性。
实验结果
研究问题
- RQ1在何种规模下,由于通信开销增加和统计效率下降,仅使用数据并行会导致训练加速效果减弱?
- RQ2如何有效结合模型并行与数据并行,以在大规模训练中维持或提升训练吞吐量?
- RQ3何种设备映射策略可使模型并行的加速效果最大化,同时最小化通信成本?
- RQ4能否通过系统化框架准确预测特定模型和硬件配置下的最佳并行策略(DP vs. 混合)?
- RQ5与仅使用数据并行相比,混合并行化在多种深度学习架构上能将端到端训练时间减少多少?
主要发现
- 对于Inception-V3,混合策略在大规模训练下相比纯数据并行实现了至少26.5%的端到端训练加速。
- 对于GNMT,混合方法相比纯数据并行至少实现了8%的端到端训练加速。
- 对于BigLSTM,混合策略相比数据并行将端到端训练时间至少减少了22%。
- DLPlacer对Inception-V3的模型并行加速预测值(1.32倍)与实测值相差仅6%,验证了其在映射优化中的准确性。
- 研究识别出每个模型独有的临界交叉点,在该点数据并行的收益递减被模型并行的加速所超越,从而实现最优混合策略选择。
- 结果表明,当GPU数量超过某一阈值后,混合并行化成为扩展深度学习训练的必要手段,此时纯数据并行已变得低效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。