Skip to main content
QUICK REVIEW

[论文解读] On the Acceleration of Deep Learning Model Parallelism with Staleness

An Xu, Zhouyuan Huo|arXiv (Cornell University)|Sep 5, 2019
Advanced Neural Network Applications被引用 7
一句话总结

本文提出了一种名为Diversely Stale Parameters(DSP)的新颖模型并行方法,通过引入逐层滞留(layer-wise staleness)打破分布式DNN训练中前向、反向和参数更新的锁竞争,从而加速深度学习训练。通过允许低层使用滞后的梯度,并将重新计算与前向传播重叠,DSP在不损失精度或增加内存占用的情况下实现了显著的速度提升,并在SGD和动量SGD下理论上保证了非凸问题的收敛性。

ABSTRACT

Training the deep convolutional neural network for computer vision problems is slow and inefficient, especially when it is large and distributed across multiple devices. The inefficiency is caused by the backpropagation algorithm's forward locking, backward locking, and update locking problems. Existing solutions for acceleration either can only handle one locking problem or lead to severe accuracy loss or memory inefficiency. Moreover, none of them consider the straggler problem among devices. In this paper, we propose Layer-wise Staleness and a novel efficient training algorithm, Diversely Stale Parameters (DSP), to address these challenges. We also analyze the convergence of DSP with two popular gradient-based methods and prove that both of them are guaranteed to converge to critical points for non-convex problems. Finally, extensive experimental results on training deep learning models demonstrate that our proposed DSP algorithm can achieve significant training speedup with stronger robustness than compared methods.

研究动机与目标

  • 为解决由于反向传播中前向、反向和参数更新锁竞争导致的模型并行在深度学习中的低效问题。
  • 克服先前方法存在的精度损失、内存膨胀或无法处理慢速设备的局限性。
  • 通过引入细粒度、层特定的滞留机制,实现在设备间的高效异步训练。
  • 为SGD和动量SGD下的非凸优化问题提供理论收敛保证。
  • 通过实证结果展示在分布式训练中显著提升速度并具备对慢速设备的鲁棒性。

提出的方法

  • 提出逐层滞留(Layer-wise Staleness),一种细粒度滞留机制,允许不同网络模块使用来自不同训练步骤的梯度。
  • 引入Diversely Stale Parameters(DSP),一种训练算法,其中低层使用更滞后的梯度,从而实现独立且异步的参数更新。
  • 将中间激活的重新计算与前向传播重叠,以减少内存消耗,避免存储所有中间结果。
  • 使用合成梯度和延迟误差传播来解耦反向传播与前向传播,消除反向和前向锁竞争。
  • 基于李雅普诺夫函数和带动量的随机梯度下降,构建收敛性分析框架,证明其可收敛至临界点。
  • 采用改进的梯度更新规则,考虑各层间不同的滞留水平,确保算法稳定性和收敛性。

实验结果

研究问题

  • RQ1引入逐层滞留是否能打破模型并行DNN训练中的前向、反向和更新锁竞争?
  • RQ2在非凸设置下,尽管使用了滞后的梯度,所提出的DSP算法是否仍能保持训练的收敛性和精度?
  • RQ3DSP是否能在不增加内存使用或降低模型性能的前提下实现显著的速度提升?
  • RQ4DSP在分布式训练环境中对慢速设备是否具备鲁棒性?
  • RQ5当各层使用不同滞留水平时,能否提供收敛性的理论保证?

主要发现

  • 与GPipe和DDG等基线方法相比,DSP实现了显著的训练加速,且无精度下降。
  • 该方法在随机慢速设备下表现出极强的鲁棒性,即使在异步执行下也能保持稳定的收敛。
  • 理论分析证明,DSP在标准SGD和动量SGD下均可收敛至非凸问题的临界点。
  • 通过将重新计算与前向传播重叠,内存消耗得以降低,无需存储所有中间激活结果。
  • 实证结果表明,DSP在深层CNN的训练吞吐量和可扩展性方面优于现有方法。
  • 收敛边界取决于滞留水平和学习率,在控制滞留水平和最优超参数下可获得更紧的边界。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。