Skip to main content
QUICK REVIEW

[論文レビュー] PanGu-Σ: Towards Trillion Parameter Language Model with Sparse Heterogeneous Computing

Xiaozhe Ren, Pingyi Zhou|arXiv (Cornell University)|Mar 20, 2023
Topic Modeling被引用数 7
ひとこと要約

PanGu-Σ は、512 個の Ascend 910 AI アクcelerator を使用して 3290 億トークンのデータでトレーニングされた 1.085 兆パラメータのスパース Mixture-of-Experts (MoE) ランゲージモデルである。ランダムルーティングエキスパート (RRE) を導入して効率的なエキスパートルーティングを実現し、エキスパート計算とストレージの分離 (ECSS) を採用することで、トレーニングスループットを 6.3 倍に向上させ、ゼロショット中国語 NLP タスクおよびファインチューニング適用において、先行モデルを上回る性能を発揮した。

ABSTRACT

The scaling of large language models has greatly improved natural language understanding, generation, and reasoning. In this work, we develop a system that trained a trillion-parameter language model on a cluster of Ascend 910 AI processors and MindSpore framework, and present the language model with 1.085T parameters named PanGu-Σ. With parameter inherent from PanGu-α, we extend the dense Transformer model to sparse one with Random Routed Experts (RRE), and efficiently train the model over 329B tokens by using Expert Computation and Storage Separation(ECSS). This resulted in a 6.3x increase in training throughput through heterogeneous computing. Our experimental findings show that PanGu-Σ provides state-of-the-art performance in zero-shot learning of various Chinese NLP downstream tasks. Moreover, it demonstrates strong abilities when fine-tuned in application data of open-domain dialogue, question answering, machine translation and code generation.

研究の動機と目的

  • 1 兆パラメータを超える大規模言語モデルを、高いトレーニング効率とシステムスループットを維持したままスケーリングすること。
  • スパース MoE モデルにおけるアンバランスなワークロードと高い通信遅延の課題を、新規ルーティング機構によって解決すること。
  • エキスパート計算とストレージのシステムレベルでの分離により、分散トレーニングにおけるホスト-デバイス間通信とオプティマイザーオーバーヘッドを低減すること。
  • 特に中国語およびマルチモーダル応用において、ゼロショットおよびファインチューニングされた下流 NLP タスクで最先端の性能を達成すること。
  • 限られたハードウェアリソースを活用した異種コンピューティング環境で、1 兆パラメータモデルの効率的でスケーラブルかつコスト効率の良いトレーニングを可能にすること。

提案手法

  • ランダムルーティングエキスパート (RRE) を提案。2段階ルーティング機構:まずエキスパートをドメイン/タスクごとにグループ化し、その後、学習可能なゲーティング関数を用いずに、各グループ内でのトークンをランダムかつ均等にエキスパートに割り当てる。
  • エキスパート計算とストレージの分離 (ECSS) を導入。エキスパート計算とストレージを分離することで、ホスト-デバイス間およびデバイス-ホスト間通信、およびオプティマイザー計算のオーバーヘッドを低減する。
  • MindSpore ディープラーニングフレームワーク内でのトランスフェルスレッド、パイプライン、データ並列化のハイブリッド並列化戦略を採用し、512 個の Ascend 910 アクセラレータにわたるトレーニングスケーリングを実現する。
  • 3290 億トークンのデータを用いて 40 か国語以上でトレーニングし、パラメータを再利用することで、密度型の PanGu-α モデルをスパース MoE アーキテクチャに拡張する。
  • モデル並列化とシステムレベル最適化の組み合わせを採用し、巨大なモデルサイズにもかかわらず高いトレーニングスループットを維持する。
  • 一般化および推論能力を評価するため、SuperGLUE および中国語 NLP ベンチマークでゼロショット評価プロトコルを適用する。

実験結果

リサーチクエスチョン

  • RQ1512 個の Ascend 910 アクセラレータで構成される制限されたクラスタ上で、高いスループットと低い通信オーバーヘッドを実現しながら、1 兆パラメータのスパース MoE モデルを効率的にトレーニングできるか?
  • RQ2学習可能なゲーティング関数を有する従来の MoE と比較して、ランダムルーティングエキスパート (RRE) メカニズムは、トレーニング効率およびモデル性能においてどのように異なるか?
  • RQ3エキスパート計算とストレージの分離 (ECSS) は、ホスト-デバイス間通信やオプティマイザー更新といったシステムレベルのボトル neck をどの程度低減するか?
  • RQ4PanGu-Σ のゼロショットおよびファイブショット性能は、多様な NLP タスク、特にリソースが限られた環境やショット数が少ない状況でどの程度の水準にあるか?
  • RQ5密度型ベースモデルからのパラメータ共有を有するスパース MoE モデルは、会話、翻訳、コード生成などの複数の下流タスクで最先端の結果を達成できるか?

主な発見

  • PanGu-Σ は、512 個の Ascend 910 アクセラレータで 1 秒あたり 69,905 トークンのトレーニングスループットを達成し、同じハイパーパramータを持つ MoE モデルと比較して 6.3 倍の向上を示した。
  • 中国語 NLP ベンチマークにおいて、ゼロショット性能が最先端を記録し、テキスト分類や質問応答などの複数のタスクで先行 SOTA モデルを上回った。
  • 380 億パラメータの英語サブモデルは、ゼロショット設定で SuperGLUE の平均スコア 64.62 を達成し、使用した英語トークン数がたった 1120 億であるにもかかわらず、GPT-3 13B モデルの平均スコア 57.2 に非常に近い性能を示した。
  • ファインチューニングされた PanGu-Σ アプリケーションは、オープンディーラの会話、機械翻訳、質問応答、コード生成の分野で優れた性能を示しており、強力な転移性を示している。
  • RRE メカニズムにより、会話やコード生成などの特殊タスク向けのサブモデルを再トレーニングなしに抽出可能となり、モデルの適応性が向上した。
  • ECSS はホスト-デバイス間通信とオプティマイザー計算を顕著に低減し、6.3 倍のスループット向上に貢献するとともに、制限されたハードウェアクラスタ上での効率的トレーニングを可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。