Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Universal Intrinsic Task Subspace via Prompt Tuning

Yujia Qin, Xiaozhi Wang|arXiv (Cornell University)|Oct 15, 2021
Topic Modeling被引用数 7
ひとこと要約

本稿では、自己符号化器を用いたソフトプロンプトの分解により、多様な自然言語処理(NLP)タスクに共通する普遍的で低次元の内部的タスク部分空間を同定する、インセンティブプロンプトチューニング(IPT)を提案する。この250次元の部分空間内でわずか250パラメータをチューニングするだけで、IPTは学習済みタスクでフルプロンプトチューニング性能の97%を回復し、未学習タスクでは83%を達成する。これは、強い汎化性能と事前学習言語モデルの普遍性の裏付けを示している。

ABSTRACT

Why can pre-trained language models (PLMs) learn universal representations and effectively adapt to broad NLP tasks differing a lot superficially? In this work, we empirically find evidence indicating that the adaptations of PLMs to various few-shot tasks can be reparameterized as optimizing only a few free parameters in a unified low-dimensional intrinsic task subspace, which may help us understand why PLMs could easily adapt to various NLP tasks with small-scale data. To find such a subspace and examine its universality, we propose an analysis pipeline called intrinsic prompt tuning (IPT). Specifically, we resort to the recent success of prompt tuning and decompose the soft prompts of multiple NLP tasks into the same low-dimensional nonlinear subspace, then we learn to adapt the PLM to unseen data or tasks by only tuning parameters in this subspace. In the experiments, we study diverse few-shot NLP tasks and surprisingly find that in a 250-dimensional subspace found with 100 tasks, by only tuning 250 free parameters, we can recover 97% and 83% of the full prompt tuning performance for 100 seen tasks (using different training data) and 20 unseen tasks, respectively, showing great generalization ability of the found intrinsic task subspace. Besides being an analysis tool, IPT could further help us improve the prompt tuning stability.

研究の動機と目的

  • 事前学習言語モデル(PLM)が多様なNLPタスクに適応する際に、共通の低次元の内部的タスク部分空間を経由しているかどうかを調査すること。
  • 少数の例設定におけるPLMの普遍性とデータ効率性を説明すること。
  • 最適化を統一的で低次元の部分空間に制限することで、パラメータ効率的な適応を可能にする手法を開発すること。
  • 部分空間解析を通じて、プロンプトチューニングの安定性を向上させるとともに、タスク間の違いについての知見を提供すること。

提案手法

  • IPTは2段階からなる:マルチタスク部分空間探索(MSF)とインセンティブ部分空間チューニング(IST)。
  • MSFでは、100の多様なNLPタスクからのソフトプロンプトが、自己符号化器アーキテクチャを用いて低次元の非線形部分空間に投影される。
  • 自己符号化器は、元のプロンプトと投影されたプロンプトの再構成誤差を最小化することで、内部的タスク部分空間の共有基底を学習する。
  • ISTでは、固定された部分空間内の低次元パラメータのみをチューニングすることでPLMを新しいタスクに適応させ、全パラメータ空間への固定されたバックプロジェクションが行われる。
  • この手法は、フルファインチューニングの代替手段としてのパラメータ効率的チューニングを活用し、スケーラブルな部分空間学習を可能にする。
  • 内部的タスク部分空間は、少数の多様な少数例タスクを用いて特定され、バランスの取れたデータスケールと汎化能力を保証する。

実験結果

リサーチクエスチョン

  • RQ1多様なNLPタスクにわたるPLMの適応を捉える普遍的で低次元の内部的タスク部分空間が存在するか?
  • RQ2この内部的部分空間は、最小限の性能低下で未学習タスクにも汎化可能か?
  • RQ3部分空間の次元が、少数例学習における性能とデータ効率性にどのように影響するか?
  • RQ4内部的部分空間は、プロンプトチューニングの安定性を向上させるとともに、タスク間の違いについての知見を提供できるか?
  • RQ5トレーニングタスクの数とデータスケールの変化が、学習された部分空間の質と汎化能力に与える影響は何か?

主な発見

  • 100のタスクから学習した250次元の内部的タスク部分空間において、IPTは異なるトレーニングデータを用いた100の学習済みタスクで、フルプロンプトチューニング性能の97%を回復した。
  • 20の未学習タスクでは、IPTがフルプロンプトチューニング性能の83%を達成した。これは、強力なゼロショット汎化能力を示している。
  • 内部的タスク部分空間は非常に効果的であり、多様なNLPタスクの適応を低次元パラメータ空間に圧縮している。
  • この手法はプロンプトチューニングの安定性を向上させ、制限された共有部分空間内で最適化することで、トレーニングの分散が低減されることを示唆している。
  • 部分空間の質は、トレーニングタスク数やデータスケールの変化に対して頑健であり、より多様なタスクが追加されるほど性能が向上する。
  • 解析により、内部的部分空間がタスク間で共通する表現構造を捉えていることが判明し、タスクの類似性と相違点に関する知見が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。