[論文レビュー] Sparsely Activated Mixture-of-Experts are Robust Multi-Task Learners
本稿では、自然言語処理における多タスク学習の改善を目的として、スパースに活性化されるMixture-of-Experts(MoE)モデル向けに、タスクに依存するゲーティング機構を提案する。異なるタスクからのトークンをタスク固有のエキスパートにルーティングしつつ、一部の重みを共有することで、より高いパラメータ効率性と頑健性を達成し、ドミナントモデルと比較して、低リソースタスクへの転移性能が優れており、未学習タスクへのサンプル効率の良い一般化、および悲観的忘却に対する耐性を示す。
Traditional multi-task learning (MTL) methods use dense networks that use the same set of shared weights across several different tasks. This often creates interference where two or more tasks compete to pull model parameters in different directions. In this work, we study whether sparsely activated Mixture-of-Experts (MoE) improve multi-task learning by specializing some weights for learning shared representations and using the others for learning task-specific information. To this end, we devise task-aware gating functions to route examples from different tasks to specialized experts which share subsets of network weights conditioned on the task. This results in a sparsely activated multi-task model with a large number of parameters, but with the same computational cost as that of a dense model. We demonstrate such sparse networks to improve multi-task learning along three key dimensions: (i) transfer to low-resource tasks from related tasks in the training mixture; (ii) sample-efficient generalization to tasks not seen during training by making use of task-aware routing from seen related tasks; (iii) robustness to the addition of unrelated tasks by avoiding catastrophic forgetting of existing tasks.
研究の動機と目的
- 競合するタスクがモデルパラメータを相反する方向に引きずるための干渉を解消すること。
- すべての入力に対してすべての重みを使用するため、パラメータの衝突や性能の劣化を引き起こす、ドミナントモデルの限界を克服すること。
- スパースなMoEモデルが多タスク学習に適応できるように、タスクに依存するゲーティング機構を設計し、入力をタスク固有のエキスパートにルーティングすること。
- スパースなMoEモデルの頑健性を、3つの主要な次元—低リソースタスクへの転移、未学習タスクへの一般化、および悲観的忘却への耐性—において評価すること。
- スパースなMoEにタスクに依存するルーティングを適用することで、ドミナント多タスクモデルに比べて、転送性、サンプル効率、およびタスク追加時の安定性において優れた性能を示すことを実証すること。
提案手法
- Mixture-of-Experts(MoE)層を備えたTransformerベースのアーキテクチャを採用し、各層にタスク固有のエキスパートとタスクに依存するゲーティングネットワークを含める。
- タスク固有のゲートを用いて、タスク識別子に基づき入力トークンを適切なエキスパートにルーティングするゲーティング機構を設計し、タスク間の干渉を低減する。
- 強力な基礎表現から効果的な多タスク適応を可能にするために、事前学習済みBERTの重みを用いてMoEモデルを初期化する。
- 計算効率を維持しつつ、条件付き計算と高いパラメータ容量を実現するため、トップ1ルーティングと負荷バランスを用いる。
- 共有エンコーダとタスク固有のエキスパートヘッドを用い、多様なNLUタスクの混合物を同時に学習する。ルーティングの決定は、タスク識別子に基づき、各トークンごとに行われる。
- 各タスクごとにルーティングの決定を分離することで、共有ゲートの競合を回避し、干渉を伴わずに専門性を発揮できるようにルーティング戦略を実装する。
実験結果
リサーチクエスチョン
- RQ1スパースなMoEモデルにおけるタスクに依存するゲーティングは、共有ゲートMoEやドミナントモデルと比較して、多タスクNLP学習におけるタスク間干渉をどれほど低減できるか?
- RQ2トレーニングミックスに関連するタスクを含めることで、スパースなMoEモデルは低リソースタスクへの知識転送をどの程度達成できるか?
- RQ3関連する学習済みタスクからのルーティングを活用することで、スパースなMoEモデルは、わずかな例のみで未学習タスクにどの程度一般化できるか?
- RQ4特に、以前に学習したタスクの悲観的忘却を避ける観点から、関係のないタスクの追加に対して、スパースなMoEモデルはどの程度頑健か?
- RQ5MoEモデルにタスクに依存するルーティングを適用することで、多様なNLUベンチマークにおいて、ドミナント多タスクモデルに比べて性能と安定性が向上するか?
主な発見
- 提案されたMT-TaGモデルは、GLUE++のSmall Tasksサブセットにおいて、単一タスクベースラインと比較して2.28ポイントの絶対的向上(83.56 vs. 81.28)を達成した。
- 全タスクベンチマークでは、MT-TaGが平均86.46のスコアを達成し、単一タスクベースライン(85.00)を上回り、多様なタスクへのスケーラビリティが強いことを示した。
- トレーニングミックスに関連するタスクを活用することで、RTE、MRPC、WiCなどの低リソースタスクに対しても、強力な転送性能を示した。
- 関連する学習済みタスクからの入力を適切なエキスパートに効果的にルーティングすることで、MT-TaGは未学習タスクへのサンプル効率の良い一般化を実現し、大規模なファインチューニングデータの必要性を低減した。
- 関係のないタスクを追加しても、以前に学習したタスクの性能を維持しており、悲観的忘却に対する頑健性を示した。
- 実証的結果から、タスクに依存するMoEルーティングは、すべての3つの主要な頑健性次元—転送、一般化、忘却への耐性—において、共有ゲートMoEおよびドミナント多タスクモデルを顕著に上回ることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。