[論文レビュー] Rail-only: A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters
本稿では、特異な通信パターンを活用することで、トロイアンパラメータを備えた大規模言語モデル(LLM)の学習に適した低コスト・高パフォーマンスなネットワークアーキテクチャ「Rail-Only」を提案する。完全な任意対任意接続ではなく、GPUを高帯域(HB)ドメインに分割し、非ゼロのトラフィックを持つドメイン間のみを接続することで、ネットワークコストを37%〜75%まで削減しながらパフォーマンスに影響を与えない。
This paper presents a low-cost network architecture for training large language models (LLMs) at hyperscale. We study the optimal parallelization strategy of LLMs and propose a novel datacenter network design tailored to LLM's unique communication pattern. We show that LLM training generates sparse communication patterns in the network and, therefore, does not require any-to-any full-bisection network to complete efficiently. As a result, our design eliminates the spine layer in traditional GPU clusters. We name this design a Rail-only network and demonstrate that it achieves the same training performance while reducing the network cost by 38% to 77% and network power consumption by 37% to 75% compared to a conventional GPU datacenter. Our architecture also supports Mixture-of-Expert (MoE) models with all-to-all communication through forwarding, with only 8.2% to 11.2% completion time overhead for all-to-all traffic. We study the failure robustness of Rail-only networks and provide insights into the performance impact of different network and training parameters.
研究の動機と目的
- トロイアンパラメータを備えた大規模言語モデル(LLM)の学習に必要な大規模GPUクラスタのコストと複雑さの増大に対処すること。
- LLM学習に完全な任意対任意ネットワーク接続が不可欠であるという仮定に挑戦すること。
- 実際のLLM通信パターンに適合したコスト効率の良いネットワークを設計し、インfraストラクチャのオーバーヘッドを低減すること。
- 余分な接続を削除することでネットワークハードウェアを最小限に抑えつつ、学習パフォーマンスを維持すること。
- LLMのハイパーパrameterとインfraストラクチャに基づいて、学習イテレーション時間を推定する分析フレームワークを提供すること。
提案手法
- LLM学習のトラフィックパターンを分析し、高帯域通信が小さな局所的GPUグループ(HBドメイン)に限定されていることを同定する。
- クラスタをHBドメインに分割し、必要なドメイン間リンクのみで接続する新しいネットワークアーキテクチャ「Rail-Only」を提案する。
- 計算、通信、並列化戦略を考慮した分析モデルを用いて、学習イテレーション時間を推定する。
- 従来のClosトポロジで非利用のリンクを排除することで、ネットワークコスト削減を定式化する。
- 故障耐性を確保するためのフェイルセーフメカニズムとリカバリ戦略をRail-Only設計に組み込む。
- 先行研究の実測値と照らし合わせて分析モデルを検証し、浮動小数点利用率の推定誤差が0.15%未満に収束した。

実験結果
リサーチクエスチョン
- RQ1LLM学習は、クラスタ内のすべてのGPU間で任意対任意のネットワーク接続を本当に必要としているのか?
- RQ2実際のLLM学習通信要件に適合したネットワークアーキテクチャを設計することでコスト削減が可能か?
- RQ3LLMのネットワーク設計を支援するため、学習イテレーション時間を正確にモデル化するにはどうすればよいか?
- RQ4大規模GPUクラスタで不要な接続を排除した場合のパフォーマンスとコストのトレードオフは何か?
- RQ5提案されたRail-Onlyアーキテクチャは、パフォーマンスを維持しながらも、大幅にネットワークハードウェアを削減できるか?
主な発見
- LLM学習では、高帯域の任意対任意通信が必要なのは小さな局所的GPUグループ(HBドメイン)に限定されており、グループ間の通信は最小限で均一である。
- Rail-Onlyアーキテクチャは、最先端のClosネットワークと比較してネットワークコストを37%〜75%まで削減し、パフォーマンスに劣化がない。
- 学習イテレーション時間の分析モデルは、先行研究の実測値と比較して、浮動小数点利用率の推定誤差が0.15%未満に収束した。
- 32,768-GPUクラスタでは、SOTA Closネットワークのスイッチ数2,560をRail-Onlyで1,536に削減し、37%のコスト削減を達成した。
- 128,000-GPUクラスタでは、トップティア構成でスイッチ数を1,280から256に削減し、コスト削減率が75%に達した。
- 論理的パーティショニングにより、クラスタを独立したドメインに分割できるため、マルチジョブ学習および推論ワークロードとも互換性を保った。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。