Skip to main content
QUICK REVIEW

[論文レビュー] ExT5: Towards Extreme Multi-Task Scaling for Transfer Learning

Vamsi Aribandi, Yi Tay|arXiv (Cornell University)|Nov 22, 2021
Topic Modeling参考文献 126被引用数 8
ひとこと要約

この論文では、107種の多様なNLPタスク(ExMix)とC4における自己教師ありスパンノイズ除去を組み合わせた大規模な混合事前学習モデルExT5を紹介している。このモデルは、SuperGLUE、GEM、Rainbow、Closed-Book QAベンチマークで最先端の性能を達成した。ExT5は、極端なマルチタスクスケーリングがゼロショットおよび微調整された転移学習を著しく向上させ、サンプルの複雑さを低減し、手作業で選別されたタスク混合や強力なT5ベースラインを上回ることを示した。

ABSTRACT

Despite the recent success of multi-task learning and transfer learning for natural language processing (NLP), few works have systematically studied the effect of scaling up the number of tasks during pre-training. Towards this goal, this paper introduces ExMix (Extreme Mixture): a massive collection of 107 supervised NLP tasks across diverse domains and task-families. Using ExMix, we study the effect of multi-task pre-training at the largest scale to date, and analyze co-training transfer amongst common families of tasks. Through this analysis, we show that manually curating an ideal set of tasks for multi-task pre-training is not straightforward, and that multi-task scaling can vastly improve models on its own. Finally, we propose ExT5: a model pre-trained using a multi-task objective of self-supervised span denoising and supervised ExMix. Via extensive experiments, we show that ExT5 outperforms strong T5 baselines on SuperGLUE, GEM, Rainbow, Closed-Book QA tasks, and several tasks outside of ExMix. ExT5 also significantly improves sample efficiency while pre-training.

研究の動機と目的

  • マルチタスク事前学習におけるタスク数のスケーリング効果が転移学習に与える影響を調査すること。
  • 大規模で多様なタスクの混合が、注意深く選別されたタスクセットを上回る可能性があるかどうかを評価すること。
  • エンコーダデコーダモデルが幅広いNLPタスクを同時に学習できるスケーラブルで統一されたフレームワークを構築すること。
  • 極端なマルチタスクスケーリングが下流タスクの転移性能およびサンプル効率に与える影響を評価すること。
  • 大規模マルチタスク事前学習が、タスク固有のカスタマイズや膨大なハイパーパramータチューニングなしで強力な性能を達成できることを実証すること。

提案手法

  • ExMixは、統一されたマルチタスク学習に適したテキスト対テキストペア形式で構成された107種の多様な英語NLPタスクのコレクションを提案する。
  • ExMixにおける教師あり学習とC4における自己教師ありスパンノイズ除去の混合を用いてExT5を事前学習し、すべてのタスクで同一の目的関数を適用する。
  • 各タスクからの割合に応じたサンプリングを適用し、データ分布のバランスを保ち、高リソースタスクへの過剰適合を防ぐ。
  • すべてのタスクで共有パラメータを持つ標準のT5アーキテクチャを採用し、パラメータ効率の良いマルチタスク学習を実現する。
  • バッチサイズ、学習率、早期停止などの標準的なトレーニングプロトコルを用い、標準ベンチマークで評価する。
  • 複数の下流タスクおよび事前学習ステップにおいて、ExT5をヴァニラT5および他のベースラインと比較する。

実験結果

リサーチクエスチョン

  • RQ1マルチタスク事前学習におけるタスク数のスケーリングは、より小さなカスタマイズされたタスクセットと比較して、下流タスクの性能を向上させるか?
  • RQ2大規模で多様なタスクの混合が、手作業で選別された組み合わせを上回る転移学習の有効性を示せるか?
  • RQ3極端なマルチタスクスケーリングにより、強力な性能に到達するための事前学習ステップ数が減少するか?
  • RQ4ExMixにおけるマルチタスク事前学習は、モデルの一般化性能およびサンプル効率にどのように影響するか?
  • RQ5大規模マルチタスク環境下で、異なるタスクファミリー間の同時学習が与える影響は何か?

主な発見

  • ExT5は79.9の平均SuperGLUEスコアを達成し、ヴァニラT5ベースライン(76.1)および最適化を図ったカスタマイズ混合(76.4)を著しく上回った。
  • ExT5は200kの事前学習ステップで79.9の平均SuperGLUEスコアを達成し、200kステップでT5.1.1の83.8を上回り、200kステップで85.3に達するなど、優れたサンプル効率を示した。
  • WiCベンチマークでは93.3の平均スコアを記録したのに対し、ヴァニラT5ベースラインは81.7であった。
  • 107タスクの全ExMix混合で学習したモデルは79.9の平均SuperGLUEスコアを達成したが、55タスクのランダムサブセットでは77.0にとどまり、より大きなタスク混合がより効果的であることが示された。
  • GEM、Rainbow、Closed-Book QAタスクにおいても、ExT5は強力なT5ベースラインを上回り、ExMixタスク以外の分野でも広範な転移性を示した。
  • 研究では、最適なタスク混合を手作業でカスタマイズすることは簡単ではなく、明示的なカスタマイズなしに大規模マルチタスク事前学習によっても正の転移が得られることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。