Skip to main content
QUICK REVIEW

[論文レビュー] Pipelined Backpropagation at Scale: Training Large Models without Batches

Atli Kosson, Vitaliy Chiley|arXiv (Cornell University)|Mar 25, 2020
Advanced Neural Network Applications参考文献 53被引用数 9
ひとこと要約

本稿では、バッチサイズ1を用いた大規模ディープラーニングモデルのための細分化・非同期パイプラインバックプロパゲーション学習法を提案する。勾配の陳腐化と重みの不一致を軽減するために、スパイク補正と線形重み予測を導入している。CIFAR-10およびImageNetにおいてResNetやVGGで標準SGDと同等の精度を達成しており、バッチ並列化のオーバーヘッドがなく、効率的なハードウェア利用が可能である。

ABSTRACT

New hardware can substantially increase the speed and efficiency of deep neural network training. To guide the development of future hardware architectures, it is pertinent to explore the hardware and machine learning properties of alternative training algorithms. In this work we evaluate the use of small batch, fine-grained Pipelined Backpropagation, an asynchronous pipeline parallel training algorithm that has significant hardware advantages. We introduce two methods, Spike Compensation and Linear Weight Prediction, that effectively mitigate the downsides caused by the asynchronicity of Pipelined Backpropagation and outperform existing techniques in our setting. We show that appropriate normalization and small batch sizes can also aid training. With our methods, fine-grained Pipelined Backpropagation using a batch size of one can match the accuracy of SGD for multiple networks trained on CIFAR-10 and ImageNet. Simple scaling rules allow the use of existing hyperparameters for traditional training without additional tuning.

研究の動機と目的

  • 従来のバッチ並列化とは異なり、低遅延・細分化並列化を好む新規ハードウェアアーキテクチャに適した代替学習アルゴリズムを探索すること。
  • 小規模または単一バッチサイズで学習する場合に生じる、重みの不一致と勾配の陳腐化によって引き起こされるパイプラインバックプロパゲーションの不安定性を解決すること。
  • パイプライン並列化のフィル・アンド・ドレインのオーバーヘッドを排除することで、大規模モデルの学習における高いハードウェア効率性とスケーラビリティを実現すること。
  • 複雑なハイパーパrameterチューニングを必要とせず、単純なスケーリング則を用いて安定した学習を実現する手法を開発すること。

提案手法

  • 非同期パイプライン学習における遅延した重み更新が引き起こす急激な大きな勾配スパイクを補正するため、スパイク補正を導入する。
  • 最近の勾配とモーメンタムに基づいて将来の重み値を推定する線形重み予測(LWP)を提案し、陳腐化した勾配の影響を低減する。
  • 重みの不一致と勾配遅延を最小限に抑えるために、マイクロバッチサイズを1に設定し、大規模な安定した学習を可能にする。
  • バッチサイズ1では効果を示さないバッチ正規化を回避するため、グループ正規化やオンライン正規化などの正規化手法を適用する。
  • 有効バッチサイズあたりの更新量を同等に保つために、単純なスケーリング則を用い、標準的なハイパーパrameterの再利用を可能にする。
  • 複数のモデル(ResNet、VGG)とデータセット(CIFAR-10、ImageNet)を用いて、標準SGDおよびPyTorch実装と比較してフレームワークの妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1バッチサイズ1のパイプラインバックプロパゲーションは、標準SGDと同等の学習安定性と精度を達成できるか?
  • RQ2細分化パイプライン環境下で、勾配の陳腐化と重みの不一致はどのように学習に影響を及ぼすか? また、それらは効果的に緩和可能か?
  • RQ3スパイク補正と線形重み予測は、膨大なハイパーパrameterチューニングを伴わず、学習を安定化させられるか?
  • RQ4バッチ正規化とは異なり、グループ正規化やオンライン正規化は低バッチ設定下でどのように性能を発揮するか?
  • RQ5単純なスケーリング則により、標準SGDのハイパーパラメータを再調整なしにパイプライン学習に直接再利用可能か?

主な発見

  • 細分化パイプラインバックプロパゲーションにバッチサイズ1と提案手法を組み合わせた場合、CIFAR-10のResNet-20およびResNet-56で標準SGDと0.5%以内のテスト精度を達成した。
  • ImageNetでは、ResNet-56でトップ1精度92.48%を達成し、標準SGDと同等の性能を示した。
  • スパイク補正と線形重み予測(LWP)は、非同期的重み更新と勾配の陳腐化が原因で生じる学習の不安定性を顕著に低減した。
  • スパイク補正とLWP${}^{ ext{v}}_{ ext{D}}$の組み合わせは、LWP${}^{ ext{w}}_{ ext{D}}$を上回り、特に小バッチ条件下で顕著な性能向上を示した。
  • グループ正規化やオンライン正規化などの正規化手法は、低バッチ学習においてバッチ正規化の代替として効果的に機能し、収束の安定性を維持した。
  • 単純なスケーリング則により、標準SGDのハイパーパラメータを再調整なしに直接再利用可能であり、新規ハードウェアへの即時導入(プラグアンドプレイ)を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。