Skip to main content
QUICK REVIEW

[論文レビュー] On the Representation Collapse of Sparse Mixture of Experts

Zewen Chi, Dong Li|arXiv (Cornell University)|Apr 20, 2022
Expert finding and Q&A systems被引用数 16
ひとこと要約

この論文は、スパース混合の専門家(SMoE)モデルにおける表現崩壊を特定し、トークン表現が専門家の重心の周囲に凝集することで性能が低下することを明らかにした。本研究では、隠れ表現を低次元の超球面に射影し、L2正規化されたルーティングスコアと学習可能な温度ゲートを用いるX-MoEを提案。これにより、7つの多言語ベンチマークで一貫した性能向上が達成され、ルーティングの安定性も向上した。

ABSTRACT

Sparse mixture of experts provides larger model capacity while requiring a constant computational overhead. It employs the routing mechanism to distribute input tokens to the best-matched experts according to their hidden representations. However, learning such a routing mechanism encourages token clustering around expert centroids, implying a trend toward representation collapse. In this work, we propose to estimate the routing scores between tokens and experts on a low-dimensional hypersphere. We conduct extensive experiments on cross-lingual language model pre-training and fine-tuning on downstream tasks. Experimental results across seven multilingual benchmarks show that our method achieves consistent gains. We also present a comprehensive analysis on the representation and routing behaviors of our models. Our method alleviates the representation collapse issue and achieves more consistent routing than the baseline mixture-of-experts methods.

研究の動機と目的

  • スパース混合の専門家(SMoE)モデルにおける未だ十分に検討されていない表現崩壊の問題を特定し、分析すること。
  • ルーティングスコアメカニズムを再定義することで、SMoEにおけるルーティングの安定性と表現の多様性を向上させること。
  • より強固なルーティングアルゴリズムを用いて、多言語事前学習および微調整性能を向上させること。
  • 複数の学習ランで一貫したルーティング行動を達成し、モデル挙動のばらつきを低減すること。

提案手法

  • ルーティングスコアを計算する前に、トークンの隠れ表現と専門家の埋め込みを低次元空間に射影する。
  • トークン表現と専門家の埋め込みの両方にL2正規化を適用し、超球面上でのルーティングスコアを測定する。
  • ソフト専門家ゲートにおける学習可能な温度パラメータを用いて、専門家の活性化を制御し、ルーティングの柔軟性を向上させる。
  • 標準的な非正規化されたドット積の代わりに、正規化された表現の超球面上での類似度(ドット積)としてルーティングを定式化する。
  • TransformerベースのSMoEモデルに新しいルーティング機構を統合し、トップ1ルーティングと、ソフトマックスおよびシグモイドゲーティング関数を併用する。
  • 多言語事前学習および下流の微調整タスクでモデルを訓練・評価し、性能とルーティングの一貫性を評価する。

実験結果

リサーチクエスチョン

  • RQ1スパース混合の専門家モデルにおいて、表現崩壊は事前学習および微調整の過程でどの程度顕在化するか?
  • RQ2低次元の超球面に表現を射影することで、表現崩壊を軽減し、モデル性能を向上させることができるか?
  • RQ3提案されたルーティング機構は、微調整における異なる乱数シードに対して、どの程度のルーティングの一貫性に影響を与えるか?
  • RQ4L2正規化されたルーティングスコアと学習可能な温度ゲートを用いることで、より安定的かつ効果的な専門家割り当てが達成できるか?
  • RQ5多言語ベンチマーク性能と表現の多様性という観点から、提案手法はベースラインSMoEモデルと比べてどの程度優れているか?

主な発見

  • 提案されたX-MoE手法は、事前学習および微調整の両方で7つの多言語ベンチマークで一貫した性能向上を達成した。
  • SMoEモデルにおいて、実証的に表現崩壊が観察された。具体的には、トークン表現が専門家の重心の周囲に強く凝集していた。
  • X-MoEは、超球面ルーティングとL2正規化を用いることで、多様性を強制し、表現崩壊を顕著に軽減した。
  • X-MoEにおけるルーティング行動は、乱数シードにかかわらず、同じようなルーティングパターンに収束するなど、高いラン間一貫性を示した。これは、SMoEベースラインとは対照的であった。
  • 本手法は、言語モデリング性能および下流タスク性能の両方を向上させ、より安定的かつ多様な専門家ルーティングに起因する。
  • ソフトゲートにおける学習可能な温度の使用により、ルーティングの適応性が向上し、性能と安定性の向上に寄与した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。