[論文レビュー] Efficient Training of Large Language Models on Distributed Infrastructures: A Survey
本サーベイは、大規模言語モデル(LLM)の分散学習システムについて、スケーラビリティ、効率性、信頼性を実現するためのインfra構造、並列処理、最適化技術を包括的に分析している。AIアクセラレータ、高帯域幅ネットワーキング、メモリおよび通信最適化、フォールトトレランスの進展を統合的に解説し、障害回復のためのライブマイグレーションとモジュールリダンドンシーを強調している。今後の大規模LLM学習の実現を可能にするために、光エレクトロニクス統合の有効性を提唱している。
Large Language Models (LLMs) like GPT and LLaMA are revolutionizing the AI industry with their sophisticated capabilities. Training these models requires vast GPU clusters and significant computing time, posing major challenges in terms of scalability, efficiency, and reliability. This survey explores recent advancements in training systems for LLMs, including innovations in training infrastructure with AI accelerators, networking, storage, and scheduling. Additionally, the survey covers parallelism strategies, as well as optimizations for computation, communication, and memory in distributed LLM training. It also includes approaches of maintaining system reliability over extended training periods. By examining current innovations and future directions, this survey aims to provide valuable insights towards improving LLM training systems and tackling ongoing challenges. Furthermore, traditional digital circuit-based computing systems face significant constraints in meeting the computational demands of LLMs, highlighting the need for innovative solutions such as optical computing and optical networks.
研究の動機と目的
- GPT や LLaMA といった大規模LLMの学習において、数万のGPUを用いて数週間から数か月にわたる学習が要求されるという、成長著しい課題に対処すること。
- 分散LLM学習における主なボトル neck を特定すること。具体的には、計算非効率性、通信オーバーヘッド、メモリ圧力、システムの信頼性欠如。
- LLMワークロードに特化した、AIアクセラレータ、高性能ネットワーキング、ストレージシステムを含む学習インfraの進展を体系的にレビューすること。
- データ並列、テンソル並列、パイプライン並列といった並列処理戦略と、それらがシステム効率性およびスケーラビリティに与える影響を分析すること。
- 計算、通信、メモリ、フォールトトレランスの最適化技術を検討し、モデルのFLOPs利用率(MFU)の向上と学習のレジリエンス強化を図ること。
提案手法
- GPUクラスタ、光インタコネクト、スケーラブルストレージシステムを含む、最近の分散LLM学習インフラ分野のイノベーションをサーベイし、分類すること。
- データ並列、テンソル並列、パイプライン並列といった並列処理方式を検討し、通信、メモリ、ロードバランスのトレードオフを分析すること。
- カーネル融合、ミックスドプレシジョン学習、ハードウェアに最適化されたオペレータスケジューリングといった計算最適化技術を調査し、MFUの向上を図ること。
- アクティベーションチェックポイント、オフローディング、パラメータの量子化といったメモリ最適化技術を分析し、GPUメモリ圧力を低減すること。
- 勾配圧縮、アラルーレッド最適化、トポロジーアウェア通信スケジューリングといった通信最適化戦略を検討すること。
- ライブマイグレーションやモジュールリダンドンシー(例:Parcae, Oobleck, Bamboo, SlipStream, SWARM)といったフォールトトレランスメカニズムを評価し、チェックポイント再読み込みなしに高速な障害回復を実現すること。

実験結果
リサーチクエスチョン
- RQ1数万のGPUにわたる分散学習システムは、モデルの正確性を維持したまま、どのようにして高いスケーラビリティを達成できるか?
- RQ2大規模LLM学習において、計算、通信、メモリの最適化をどのように行うことで、モデルFLOPs利用率(MFU)を最大限に高められるか?
- RQ3数週間から数か月にわたる長期にわたる学習プロセスにおいて、ハードウェア、ネットワーク、ソフトウェアの障害に直面しても、システムの信頼性をどのように維持できるか?
- RQ4光コンピューティングやフォトニクスインタコネクトといった新技術が、従来のデジタル回路ベースのシステムの限界を克服するために果たす役割は何か?
- RQ5ライブマイグレーションとモジュールリダンドンシーは、従来のチェックポイントベースの回復と比較して、LLM学習における障害回復をどのように高速化できるか?
主な発見
- LLaMA-3 を 16,384 個の H100 GPU で学習するには約 54 日を要し、極めて高い計算要求と、効率的な分散システムの必要性を示している。
- モデルFLOPs利用率(MFU)は効率性の重要な指標であり、計算、通信、メモリの最適化が、その向上に不可欠である。
- Parcae や Oobleck で採用されているライブマイグレーション技術により、既存のモデルレプリカを用いて動的に学習パイプラインを再構成することで、高速な障害回復が可能になる。
- Bamboo や SlipStream といったモジュールリダンドンシー手法により、障害発生時に計算を冗長モジュールに再ルーティングすることで、学習を途切れなく継続できる。
- SWARM は、冗長計算とインスタンスマイグレーションを統合し、異種かつ不安定なクラスタ環境でも、実運用におけるフォールトトレランスを向上させている。
- 光コンピューティングやフォトニクスインタコネクト(例:TopoOpt や TPUv4)は、通信効率の向上を実現し、ムーアの法則の限界を超えた将来のスケールのLLM学習を可能にする可能性を示している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。