[論文レビュー] Model Parallelism on Distributed Infrastructure: A Literature Review from Theory to LLM Case-Studies
この論文は分散ディープラーニングにおけるモデル並列化について包括的な文献レビューを提供し、インラインオペレータ型とインターオペレータ型に分類し、通信オーバーヘッドや最適でない分割といった主な課題を特定し、メガトロンやパルムのような数十億パラメータのトランスフォーマー・モデルにおける現代的応用を分析している。ハイブリッド並列化(インラインおよびインターオペレータ戦略の組み合わせ)が大規模モデルのスケーリングに不可欠であることが強調されており、専用ハードウェアによりパルムのようなモデルにおける効率的なインラインオペレータ並列化が可能になっている。
Neural networks have become a cornerstone of machine learning. As the trend for these to get more and more complex continues, so does the underlying hardware and software infrastructure for training and deployment. In this survey we answer three research questions: "What types of model parallelism exist?", "What are the challenges of model parallelism?", and "What is a modern use-case of model parallelism?" We answer the first question by looking at how neural networks can be parallelised and expressing these as operator graphs while exploring the available dimensions. The dimensions along which neural networks can be parallelised are intra-operator and inter-operator. We answer the second question by collecting and listing both implementation challenges for the types of parallelism, as well as the problem of optimally partitioning the operator graph. We answer the last question by collecting and listing how parallelism is applied in modern multi-billion parameter transformer networks, to the extend that this is possible with the limited information shared about these networks.
研究の動機と目的
- 分散ディープラーニングシステムで用いられるモデル並列化のタイプを体系的に分類・定義すること。
- モデル並列化の実装における主な技術的・アーキテクチャ的課題(通信ボトル neck やオペレータグラフの最適でない分割など)を特定・分析すること。
- 現代の大規模言語モデル(LLM)におけるモデル並列化の実世界応用、特に数十億パラメータのトランスフォーマー・モデルを調査すること。
- メモリ使用量、実行時間、デバイス利用率の観点から、異なる並列化戦略のトレードオフを評価すること。
- DNNオート並列化の分野における標準化を提唱し、再現可能なベンチマークと分野への広範なアクセスを可能にすること。
提案手法
- 本研究は二段階のスノーボール文献レビュー法を用いる:第一段階では理論的モデリングのためのDNNオート並列化技術を分析し、第二段階では実世界のLLM導入事例を調査する。
- モデル並列化は、並列化が2つの次元(インラインオペレータ:単一の演算内、インターオペレータ:複数の演算間)に沿って定義されるオペレータグラフを通じて形式化される。
- 実行シミュレータを用いて、デバイス特性、テンソルサイズ、通信オーバーヘッドに基づき実行時間を推定することで、FlexFlow や TensorOpt などのオート並列化フレームワークを評価する。
- FlexFlowでは、シミュレートされたパフォーマンス指標に従ってガイドされるマーカフチェーン・モンテカルロ探索戦略を用いて並列化の探索空間を探索する。
- 論文は、モデル並列化に関する詳細な実装インサイトを含む、メガトロン、ゴファー、パルム、GPT などの実世界のLLMを収集・フィルタリングして分析する。
- 分析には、ハードウェア利用率、通信パターン、および専用ハードウェア(例:TPUv4、A100)がインラインオペレータ並列化を効率的に行う上で果たす役割が含まれる。

実験結果
リサーチクエスチョン
- RQ1モデル並列化にはどのようなタイプがあり、オペレータグラフの観点からどのように定義されるか?
- RQ2特に分散システムにおいて、モデル並列化を実装するにあたり主な技術的・アーキテクチャ的課題は何か?
- RQ3メガトロン、パルム、ゴファーのような現代の大規模トランスフォーマー・モデルでは、モデル並列化はどのように応用されているか?
- RQ4通信、メモリ、デバイス利用率の観点から、インラインオペレータ並列化とインターオペレータ並列化の間にはどのようなトレードオフがあるか?
- RQ5表現形式とベンチマークの標準化を通じて、DNNオート並列化分野はどのように改善できるか?
主な発見
- モデル並列化は主にインラインオペレータ(単一の演算内)型とインターオペレータ(複数の演算間)型に分類され、実際には両方を組み合わせたハイブリッド戦略が一般的である。
- インラインオペレータ並列化は、特にイーサネットのような遅いインタコネクトを介して頻繁にデータシャッフルが発生するため、極めて高い通信コストを伴う。
- インターオペレータ並列化は、負荷の不均衡や不規則な計算パターンのため、トレーニング中にデバイスの利用率が低くなる傾向がある。
- デバイスにオペレータグラフを最適に分割することは大きな課題であり、モデルグラフの構造がしばしば下位のデバイストポロジーと整合しないからである。
- パルムのような現代のLLMは、専用ハードウェア(例:TPUv4)を用いてインラインオペレータ通信コストを軽減し、インターオペレータ分割に依存せずに効率的なモデル並列化を実現している。
- メガトロンやゴファーのようなモデルは、ノード内でのインラインオペレータ並列化とノード間でのインターオペレータ並列化およびデータ並列化を組み合わせることで、単一ノードの制限を超えてスケーリングしている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。