Skip to main content
QUICK REVIEW

[論文レビュー] Whale: Efficient Giant Model Training over Heterogeneous GPUs

Xianyan Jia, Le Jiang|arXiv (Cornell University)|Nov 18, 2020
Advanced Neural Network Applications被引用数 10
ひとこと要約

Whaleは、混合並列戦略の統一的表現を可能にする2つのモデルアノテーションプリミティブを導入することで、異種のGPU上でトランジリオンパラメータモデルの効率的でスケーラブルな学習を可能にする高水準のディープラーニングフレームワークです。分散グラフ最適化とハードウェアに適した負荷分散を自動化し、512個のV100 GPUで10兆パラメータの学習を実現しました。コード変更は最小限で、高い効率性を達成しています。

ABSTRACT

The scaling up of deep neural networks has been demonstrated to be effective in improving model quality, but also encompasses several training challenges in terms of training efficiency, programmability, and resource adaptability. We present Whale, a general and efficient distributed training framework for giant models. To support various parallel strategies and their hybrids, Whale generalizes the programming interface by defining two new primitives in the form of model annotations, allowing for incorporating user hints. The Whale runtime utilizes those annotations and performs graph optimizations to transform a local deep learning DAG graph for distributed multi-GPU execution. Whale further introduces a novel hardware-aware parallel strategy, which improves the performance of model training on heterogeneous GPUs in a balanced manner. Deployed in a production cluster with 512 GPUs, Whale successfully trains an industry-scale multimodal model with over ten trillion model parameters, named M6, demonstrating great scalability and efficiency.

研究の動機と目的

  • 異種のGPUクラスタ上でトランジリオンパラメータを持つ巨大なディープラーニングモデルを学習する際の課題に対処すること。
  • データ並列、モデル並列、パイプライン並列といった複雑な並列戦略を手動で管理する作業負荷を低減すること。
  • ランタイムに適した最適化を通じて、モデル開発と異種のハードウェア環境のギャップを埋めること。
  • コード変更なしで1000億から1兆パラメータにスケーリングすることを可能にすること。
  • 自動グラフリライトを通じて、最小限のパフォーマンスオーバーヘッドでハイブリッド並列戦略をサポートすること。

提案手法

  • すべての並列戦略およびそのハイブリッドを表現できる2つの高水準プリミティブをモデルアノテーションを通じて導入し、プログラミングと低レベルの分散論理を分離すること。
  • これらのアノテーションを活用して自動グラフ最適化を実行し、局所的な計算グラフを効率的な分散実行計画に変換すること。
  • 計算能力とメモリ容量に基づいてモデルパーティションをGPUにマッピングするハードウェアに適した負荷分散アルゴリズムを採用し、リソース利用効率を向上させること。
  • グラフ置換とパターンマッチングを適用して、能力が異なる複数のGPU上で効率的に実行可能な計算グラフを再書き換えすること。
  • TensorFlowと統合し、テンソル並列およびパイプライン並列を含むモデルコンponentsの自動分散を実現し、手動でのデバイス配置を不要にすること。
  • テンソルオフロードとメモリ最適化技術を活用してGPUメモリ制限を超えてスケーリングし、10兆パラメータの学習を可能にすること。

実験結果

リサーチクエスチョン

  • RQ1どのようにしてディープラーニングフレームワークが、データ並列、モデル並列、パイプライン並列などの混合並列戦略を、最小限のユーザ作業で効率的にサポートできるか?
  • RQ2高水準のアノテーションと自動グラフ最適化により、異種のGPUクラスタ上でトランジリオンパラメータモデルの効率的学習が可能になるか?
  • RQ3ハードウェアの非均一性を効果的に管理することで、巨大モデル学習におけるワークロードのバランスとボトルネックの回避が可能か?
  • RQ41000億から1兆パラメータのモデルサイズの範囲で、統合フレームワークのパフォーマンスとスケーラビリティはどの程度か?
  • RQ5グラフ最適化技術は、特に複雑なハイブリッド並列戦略を伴う大規模分散学習に効果的に適用可能か?

主な発見

  • Whaleは、512個の異種V100 GPUを搭載したクラスタ上で、10兆パラメータのマルチモーダルモデル(M6)を効率的に学習させ、強力なスケーラビリティを示した。
  • 異なるモデルコンponentにデータ並列とモデル並列を組み合わせることで、勾配同期のオーバーヘッドを89.7%削減した。
  • コード変更なしで1000億から10兆パラメータにスケーリングされたことから、フレームワークの柔軟性と使いやすさが顕著に示された。
  • ハードウェアに適した負荷分散アルゴリズムにより、計算とメモリワークロードのバランスを効果的にとることで、異種GPU上でのパフォーマンスが向上した。
  • 高水準の抽象化によりユーザ作業を大幅に削減しながらも、高い効率性とスケーラビリティを維持したため、既存のフレームワークを上回った。
  • 480個のV100 GPU上で1兆パラメータのモデルを効率的に学習させ、2048個のTPUコアを用いた最先端の性能と同等の結果を得た。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。