[論文レビュー] MiCS: Near-linear Scaling for Training Gigantic Model on Public Cloud
MiCSは、スケールに配慮したモデル分割、階層的通信、2ホップ勾配同期を活用して通信スケールを最小限に抑えることで、パブリッククラウド上での巨大ディーブラーニングモデルの近線形スケーラブルなトレーニングシステムを提案する。1000億パラメータのモデルを512 GPUでトレーニングする際、DeepSpeed ZeROを上回り、最大2.89倍の高いスループットと99.4%の弱スケーリング効率を達成し、非均質的かつ帯域幅が制限されたクラウド環境でも優れた性能を発揮する。
Existing general purpose frameworks for gigantic model training, i.e., dense models with billions of parameters, cannot scale efficiently on cloud environment with various networking conditions due to large communication overheads. In this paper, we propose MiCS, which Minimizes the Communication Scale to bring down communication overhead. Specifically, by decreasing the number of participants in a communication collective, MiCS can utilize heterogeneous network bandwidth, reduce network traffic over slower links, reduce the latency of communications for maintaining high network bandwidth utilization, and amortize expensive global gradient synchronization overhead. Our evaluation on AWS shows that the system throughput of MiCS is up to 2.89$ imes$ that of the state-of-the-art large model training systems. MiCS achieves near-linear scaling efficiency, which is up to 1.27$ imes$ that of DeepSpeed. MiCS allows us to train a proprietary model with 100 billion parameters on 512 GPUs with 99.4% weak-scaling efficiency, and it is able to saturate over 54.5% theoretical computation power of each GPU on a public cloud with less GPU memory and more restricted networks than DGX-A100 clusters.
研究の動機と目的
- パブリッククラウドにおける非均質的かつ帯域幅が制限されたネットワーク環境に展開された既存の大規模モデルトレーニングフレームワークにおける高い通信オーバーヘッドを解消すること。
- DGXクラスタとは異なり、高速なInfiniBandインターコネクトを備えないパブリッククラウドクラスタにおいて、トレーニングスループットとスケーラビリティを向上させること。
- 特別なハードウェアや複雑なモデル並列化を必要とせず、標準的なパブリッククラウドGPUインスタンス上で巨大モデル(例:1000億パラメータ)を効率的にトレーニングできること。
- 大規模かつ非均質的なクラスタ環境において、通信コストを顕著に削減しながらも、データ並列化の単純さと汎用性を維持すること。
- 制限されたネットワーク条件であっても、高価なクラスタと同等の近線形スケーリング効率を達成できること。
提案手法
- スケールに配慮したモデル分割を導入し、GPUをより小さな独立したグループに分割。各グループがモデル状態の完全なコピーを保持することで、頻繁なパラメータ同期の参加者数を削減する。
- 階層的通信戦略を採用し、集合的通信操作をグループ内に限定するとともに、グループ間通信を並列化することで、遅延の高いノード間リンクでのトラフィックを削減する。
- 2ホップ勾配同期メカニズムを設計。グローバルなアトムリダクション操作を回避するため、まずグループ内で勾配を集約し、次にグループレベルの要約をグループ間で同期する。
- GPUメモリ容量とネットワークトポロジーに応じてパーティショングループを構成し、メモリ使用量と通信効率のバランスを取る。グループサイズは調整可能なパラメータとして扱う。
- 既存のデータ並列フレームワーク(例:ZeRO)を活用するが、通信パターンを再設計することで、ノード内での高帯域幅リンクを活用し、ノード間の遅延とデータ量を削減する。
- モデル状態のレプリケーションに最適なグループサイズを決定するヒューリスティックを用いることで、メモリ効率を確保するとともに、通信ボトルネックを最小限に抑える。
実験結果
リサーチクエスチョン
- RQ1データ並列トレーニングシステムは、非均質的かつ帯域幅が制限されたパブリッククラウドクラスタにおいて、近線形スケーリングを達成できるか?
- RQ2InfiniBandのような専用ハードウェアに依存せずに、大規模モデルトレーニングにおける通信オーバーヘッドをどのように低減できるか?
- RQ3通信参加者の数を最小限に抑えることで、大規模GPUクラスタにおけるトレーニングスループットとスケーラビリティがどの程度向上するか?
- RQ4複雑なモデル並列化やパイプライン並列化を回避しながらも、高い効率と低い通信コストを維持できるか?
- RQ5限られたGPUメモリと変動するネットワーク帯域幅という実際のパブリッククラウドの制約下で、システムはどのように動作するか?
主な発見
- MiCSは、AWS上でのDeepSpeed ZeROと比較して、最大2.89倍の高いシステムスループットを達成し、大規模トレーニングにおける顕著な性能向上を示した。
- 1000億パラメータのモデルを512 GPUでトレーニングする際、99.4%の弱スケーリング効率を達成し、近線形スケーリングが実現された。
- MiCSは、各GPUの理論的計算能力の54.5%以上を活用し、GPUあたりのメモリ使用率が32%未満の状態で、同じ条件下でZeROを上回る性能を発揮した。
- 階層的通信戦略により、ノード間ネットワークトラフィックと遅延が低減され、遅延の高いノード間リンクでも高い帯域幅利用率を実現した。
- 2ホップ勾配同期メカニズムにより、グローバルなアトムリダクション操作をグループレベルの要約に限定することで、大規模クラスタにおける効率が向上した。
- 限られたGPUメモリと制限されたネットワーク帯域幅の下でも、MiCSは高いパフォーマンスを維持でき、標準的なパブリッククラウド環境への実用的適用が可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。