Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Large Scale Language Modeling with Mixtures of Experts

Mikel Artetxe, Shruti Bhosale|arXiv (Cornell University)|Dec 20, 2021
Topic Modeling被引用数 13
ひとこと要約

本論文は、条件付き計算を活用して1トークンあたりのパラメータのサブセットのみをアクティブ化することで、効率的な大規模言語モデル化を実現するMixture of Experts (MoE)言語モデルの提案と実験的評価を行う。MoEモデルは、最大4倍少ない計算量で密度型モデルと同等の性能を達成し、1.1兆パラメータのMoEモデルが計算量に相当する67億パラメータの密度型モデルを上回る。これは、多様なNLPタスクにおいて顕著な計算効率性を示している。

ABSTRACT

Mixture of Experts layers (MoEs) enable efficient scaling of language models through conditional computation. This paper presents a detailed empirical study of how autoregressive MoE language models scale in comparison with dense models in a wide range of settings: in- and out-of-domain language modeling, zero- and few-shot priming, and full-shot fine-tuning. With the exception of fine-tuning, we find MoEs to be substantially more compute efficient. At more modest training budgets, MoEs can match the performance of dense models using $\sim$4 times less compute. This gap narrows at scale, but our largest MoE model (1.1T parameters) consistently outperforms a compute-equivalent dense model (6.7B parameters). Overall, this performance gap varies greatly across tasks and domains, suggesting that MoE and dense models generalize differently in ways that are worthy of future study. We make our code and models publicly available for research use.

研究の動機と目的

  • Mixture of Experts (MoE) モデルと密度型モデルを比較し、大規模言語モデル化における効率性と性能を調査すること。
  • ドメイン内およびドメイン外の言語モデル作成、ゼロショットおよびフェイントショットのプロンプティング、フルショット微調整の多様な設定において、MoEモデルの性能を評価すること。
  • スケールが大きい場合に、MoEモデルが密度型モデルとは異なる一般化行動を示すかどうか、また制限された計算予算下でも性能優位性を維持するかどうかを特定すること。
  • 特に中程度の訓練予算下で、MoEモデルが顕著に低い計算コストで最先端の性能を達成できることを示すこと。

提案手法

  • 著者らは、数億から1兆を超えるパラメータを持つ、自己回帰的MoEおよび密度型トランスフォーマーに基づく言語モデルを訓練した。
  • MoEレイヤーは、1トークンあたり上位2つのエキスパートを選択するルーターネットワークを用い、入力ごとにパラメータのサブセットのみをアクティブ化する条件付き計算を実現した。
  • 訓練中にメモリ使用量を削減するため、混合精度訓練(FP16オプティマイザーステート)とアクティベーションチェックポイント技術を採用した。
  • 大規模なモデルサイズへのスケーリングを実現するために、完全シャーディングデータ並列(FSDP)を用い、モデルパラメータ、勾配、オプティマイザーステートを複数のGPUに分散させた。
  • FLOPの計算は解析的に実施され、アクティベーションチェックポイントとMoEの前向き伝搬ネットワークに起因する追加FLOPsを考慮した。MoEモデルのFLOPsは、密度型モデルと比較して32Tlh²増加した。
  • 複数のベンチマークを用いて、計算量に相当する条件でのモデル性能を比較した。対象となるベンチマークには、ドメイン内およびドメイン外の言語モデル作成(Pile)、ゼロショットプロンプティング、微調整が含まれる。

実験結果

リサーチクエスチョン

  • RQ1中程度の訓練予算下で、MoEモデルは、特に中程度の訓練予算下で、計算量を大幅に削減しながら密度型モデルと同等の性能を達成できるか?
  • RQ2多様なNLPタスクにおいて、ゼロショットおよびフェイントショットプロンプティング設定下で、MoEモデルは密度型モデルと比較してどのように性能を発揮するか?
  • RQ3スケールが大きくなると、MoEモデルと密度型モデルの性能差は維持されるか、あるいは縮小するか。また、MoEアーキテクチャは異なる一般化行動を示すか?
  • RQ4異なるモデルサイズおよび訓練予算下で、MoEモデルの計算効率的利点はどの程度か?
  • RQ5MoEモデルと密度型モデルは、タスクやドメインに応じて異なる一般化行動を示すか?

主な発見

  • 中程度の訓練予算下では、MoEモデルは約4倍少ない計算量で密度型モデルと同等の性能を達成し、顕著な計算効率性を示した。
  • 大規模なスケール(約5000 GPU日)下でも、最大のMoEモデル(1.1兆パラメータ)は、計算量に相当する密度型モデル(67億パラメータ)を下回る性能を、下流タスクで示した。
  • MoEモデルと密度型モデルの性能差は、タスクやドメインによって顕著に異なるため、異なる一般化行動が示されていることがわかった。
  • MoEモデルはゼロショットおよびフェイントショット設定でも優れた性能を維持しており、条件付き計算が文脈学習能力を損なわないことを示した。
  • FSDPとアクティベーションチェックポイントの活用により、標準的なハードウェア上でも1兆を超えるパラメータを持つMoEモデルの訓練が可能となり、大規模なMoE訓練が現実的になった。
  • 解析的FLOP推定により、MoE訓練が予測可能で管理可能な計算増加を伴うことが確認された。主な要因は、追加のエキスパート前向き伝搬ネットワークに起因する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。