Skip to main content
QUICK REVIEW

[論文レビュー] MoEfication: Conditional Computation of Transformer Models for Efficient Inference

Zhengyan Zhang, Yankai Lin|arXiv (Cornell University)|Oct 5, 2021
Topic Modeling参考文献 40被引用数 6
ひとこと要約

この論文では、モデルサイズに変化がないまま標準的なモデルをスパースなエキスパートの混合(MoE)アーキテクチャに変換することで、Transformerの推論を高速化する手法「MoEfication」を提案する。フィードフォワードネットワーク(FFN)のパラメータをエキスパートに分割し、ルーターを用いて入力に応じてわずかなサブセットのみを活性化することで、MoEficationは推論時に最大80%の計算量削減を達成する—例えば7億パラメータのモデルではFFNパラメータの20%のみを活性化する—テキスト分類および読解理解タスクにおいて性能の低下なしに実現する。

ABSTRACT

Transformer-based pre-trained language models can achieve superior performance on most NLP tasks due to large parameter capacity, but also lead to huge computation cost. Fortunately, we find by empirical study that, most inputs only activate a tiny ratio of neurons during inference. Hence, we explore to accelerate large-model inference by conditional computation based on the sparse activation phenomenon. We propose to transform a large model into its mixture-of-experts (MoE) version with equal model size, namely MoEfication. Model MoEfication consists of two steps: (1) splitting the parameters of feed-forward neural networks (FFNs) into multiple parts as experts, and (2) building expert routers to decide which experts will be used for each input. To further improve the performance of MoEfied models, we can also fine-tune the models on downstream tasks, namely parameter calibration. Experimental results show that the MoEfied models can significantly reduce computation cost, e.g., only activating 20% FFN parameters of a 700-million-parameter model without performance degradation on several downstream tasks including text classification and reading comprehension.

研究の動機と目的

  • 大規模事前学習済みTransformerモデルの推論における高い計算コストを軽減すること。
  • 入力ごとにわずかな数のニューロンが活性化されるという経験的事実を活用し、スパースな計算を実現すること。
  • 元のモデルと同一のパラメータ数を維持しつつ、標準モデルをMoEアーキテクチャに変換する手法を設計すること。
  • 下流NLPタスクにおける性能の低下なしに推論効率を向上させること。
  • 実世界のベンチマークを用いた微調整および定量的評価を通じて、MoEficationの有効性を検証すること。

提案手法

  • Transformerのフィードフォワードネットワーク(FFN)パラメータを複数のエキスパートサブネットワークに分割すること。
  • 入力に応じたルーティングに基づき、各入力トークンに対してどのエキスパートを活性化するかを動的に選択するエキスパートルーターを導入すること。
  • パラメータをエキスパートに分散させることで、モデルサイズを増加させずに元のモデルと同一の総パラメータ数を維持すること。
  • 下流タスクでの性能向上を図るため、微調整によるパラメータキャリブレーションを適用すること。
  • 推論中にわずかなサブセットのエキスパートのみを活性化する条件付き計算を適用し、FLOPsを削減すること。
  • 標準モデルで経験的に観察されるスパースな活性化パターンを活用し、エキスパートルーティングと効率性の向上を支援すること。

実験結果

リサーチクエスチョン

  • RQ1スパースな活性化パターンを活用することで、大規模Transformerモデルにおける推論効率を顕著に向上させられるか?
  • RQ2元のモデルと同一のパラメータ数を維持する形で標準Transformerをエキスパートの混合(MoE)アーキテクチャに変換しても、モデル性能が保持されるか?
  • RQ3性能の低下なしに、条件付き計算が推論時のFLOPsをどの程度削減できるか?
  • RQ4微調整によるパラメータキャリブレーションは、MoEfiedモデルの性能向上にどの程度効果的か?
  • RQ5MoEficationは、テキスト分類や読解理解を含む多様なNLPタスクに効果的に適用可能か?

主な発見

  • MoEficationは推論時に計算コストを最大80%まで削減し、7億パラメータのモデルではFFNパラメータの20%のみが活性化される。
  • MoEfiedモデルは、元のモデルと比較してテキスト分類および読解理解などの下流タスクにおいて、性能の低下なしに同等の性能を維持する。
  • 元のモデルと同一の総パラメータ数を維持することで、モデル容量を保持しつつ顕著な効率性向上を達成する。
  • 微調整(パラメータキャリブレーション)により、MoEfiedモデルの下流タスクにおける性能が向上し、その有効性が確認される。
  • 経験的分析により、多数の入力がわずかな数のニューロンしか活性化しないことが確認され、MoEficationにおける条件付き計算の基盤が妥当であることが裏付けられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。