Skip to main content
QUICK REVIEW

[論文レビュー] SWARM Parallelism: Training Large Models Can Be Surprisingly Communication-Efficient

Max Ryabinin, Tim Dettmers|arXiv (Cornell University)|Jan 27, 2023
Advanced Neural Network Applications被引用数 6
ひとこと要約

SWARM並列処理は、信頼性が低く、異種で帯域幅が限られた環境を想定した分散型で耐障害性を持つモデル並列学習アルゴリズムです。確率的接続による動的再平衡パイプラインを用いることで通信オーバーヘッドを低減し、200 Mb/s未満のネットワーク帯域幅でもプリエンプティブルなT4 GPU上で数十億パラメータのTransformerモデルを学習可能にし、スケア・キューブ則と8ビット量子化を活用して高いスループットとコスト効率を実現します。

ABSTRACT

Many deep learning applications benefit from using large models with billions of parameters. Training these models is notoriously expensive due to the need for specialized HPC clusters. In this work, we consider alternative setups for training large models: using cheap "preemptible" instances or pooling existing resources from multiple regions. We analyze the performance of existing model-parallel algorithms in these conditions and find configurations where training larger models becomes less communication-intensive. Based on these findings, we propose SWARM parallelism, a model-parallel training algorithm designed for poorly connected, heterogeneous and unreliable devices. SWARM creates temporary randomized pipelines between nodes that are rebalanced in case of failure. We empirically validate our findings and compare SWARM parallelism with existing large-scale training approaches. Finally, we combine our insights with compression strategies to train a large Transformer language model with 1B shared parameters (approximately 13B before sharing) on preemptible T4 GPUs with less than 200Mb/s network.

研究の動機と目的

  • プリエンプティブルなクラウドインスタンスや統合された異種リソースのような、コスト効率が高く信頼性が低い環境での大規模モデル学習を可能にすること。
  • 既存のモデル並列アルゴリズムがデバイス障害、ネットワーク不安定性、異種ハードウェアの処理に直面する限界を克服すること。
  • モデルサイズの増大に伴い計算量と通信量の成長割合が変化するスケア・キューブ則を活用し、並列学習における通信オーバーヘッドを低減すること。
  • 低帯域幅で信頼性が低いデバイス上で数十億パラメータのモデルにスケーラブルな分散型で耐障害性を持つ学習フレームワークを開発すること。

提案手法

  • SWARM並列処理は、ノード間でランダムに一時的なパイプラインを構築することで、耐障害性と動的負荷分散を実現します。
  • デバイス性能やネットワーク遅延の変動に応じて、定期的にパイプライン段階を再平衡します。
  • アルゴリズムは分散型であり、中央コordinaterに依存せず、安定的で低遅延のピアを優先して通信を行います。
  • 8ビットブロック単位の量子化を統合することで、活性化値の通信量を半減させつつ、精度の著しい低下を防ぎます。
  • さらに帯域幅要件を削減するために、圧縮に強いアーキテクチャ(例:マックスアウト、ボトルネック)を適用します。
  • スケア・キューブ則を活用し、モデルサイズが大きくなることで計算量の増加が通信量の増加を上回るようになり、相対的な通信コストが低下します。

実験結果

リサーチクエスチョン

  • RQ1パイプライン並列設定において、より大きなモデルを学習することで、従来の直感とは逆に相対的な通信オーバーヘッドを低減できるか?
  • RQ2分散型で異種の環境において、デバイス障害やネットワークの不安定性に強く、モデル並列学習をどのようにして耐性を持たせられるか?
  • RQ3学習スループットやモデル品質を損なわずに、通信帯域幅をどの程度まで低減できるか?
  • RQ4SWARM並列処理は、200 Mb/s未満のネットワーク接続を持つ低コストのプリエンプティブルGPU上で、高い学習効率を達成できるか?
  • RQ5SWARM並列処理、圧縮、スケア・キューブ則の組み合わせが、数十億パラメータのモデルのコスト効率の良い学習をどのように可能にするか?

主な発見

  • SWARM並列処理により、200 Mb/s未満のネットワーク帯域幅でプリエンプティブルなT4 GPU上で10億パラメータの共有パラメータを持つTransformerモデルの学習が可能となった。
  • アルゴリズムは、標準的な同期型データ並列学習と同等の学習スループットを達成しており、ランダムシードのばらつきの範囲内で収束曲線が一致した。
  • 8ビット量子化を用いることで、活性化値の通信量が半減し、精度の低下は最小限に抑えられた。
  • 32台のプリエンプティブルなT4 GPU上でALBERT-Largeモデルを学習した総コストは497.80ドルであり、信頼性の高いV100と比較して64%低いコストで実現された。
  • スケア・キューブ則により、より大きなモデルでは相対的な通信コストが低下し、低帯域幅環境でも学習が可能になった。
  • 圧縮に強いアーキテクチャ(例:マックスアウト)を用いることで、特に高い圧縮比の場合に帯域幅の要件をさらに削減でき、分布内および分布外の性能に悪影響を与えない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。