Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Low-dimensional Intrinsic Task Subspace via Prompt Tuning.

Yujia Qin, Xiaozhi Wang|arXiv (Cornell University)|Oct 15, 2021
Topic Modeling参考文献 31被引用数 22
ひとこと要約

本論文は、事前学習言語モデル(PLM)におけるプロンプトチューニングを再パrameter化するためのインセンティブプロンプトチューニング(IPT)を提案する。IPTは最適化を低次元の共有内在タスク部分空間に制限することで、100のタスクから学習された5次元部分空間内で5つのパラメータのみをチューニングすることで、観測済みタスクではフルプロンプトチューニング性能の87%、未観測タスクでは65%の性能を達成し、優れた一般化性能と安定性を示している。

ABSTRACT

How can pre-trained language models (PLMs) learn universal representations and effectively adapt to broad NLP tasks differing a lot superficially? In this work, we empirically find evidences indicating that the adaptations of PLMs to various tasks can be reparameterized as optimizing only a few free parameters in a common low-dimensional intrinsic task subspace, which may help us understand why PLMs could easily adapt to various NLP tasks with small-scale data. Specifically, to find such a subspace and examine its universality, we resort to the recent success of prompt tuning and decompose the soft prompts of multiple NLP tasks into the same low-dimensional nonlinear subspace, then we learn to adapt the PLM to unseen tasks or data by only tuning parameters in the subspace. We dub this pipeline as intrinsic prompt tuning (IPT). In experiments, we study diverse few-shot NLP tasks and surprisingly find that in a 5-dimensional subspace found with 100 random tasks, by only tuning 5 free parameters, we can recover 87% and 65% of the full prompt tuning performance for 100 seen tasks (using different training data) and 20 unseen tasks, respectively, showing great generalization ability of the found intrinsic task subspace. Besides being an analysis tool, IPT could further bring practical benefits, such as improving the prompt tuning stability.

研究の動機と目的

  • 事前学習言語モデル(PLM)が最小限のファインチューニングで多様なNLPタスクにうまく一般化する理由を理解すること。
  • 異なるタスクへのPLMの適応が、共通の低次元部分空間に統一可能かどうかを調査すること。
  • 共有部分空間内でわずか数パラメータを最適化することで、未観測タスクへの効果的なフェイシュット適応を可能にする手法を開発すること。
  • 共有内在タスク部分空間におけるパラメータ再パラメータ化を通じて、プロンプトチューニングの安定性と効率性を向上させること。

提案手法

  • 100の多様なNLPタスクからのソフトプロンプトを、プロンプトチューニングを用いて共通の低次元非線形部分空間に分解する。
  • 多様なタスクからなるセットから、普遍的な適応パターンを捉えるための共有基底を学習する。
  • フルソフトプロンプトベクトルではなく、学習済み部分空間内の低次元パラメータのみを最適化することでプロンプトチューニングを実行する。
  • 同じ部分空間を用いて観測済みおよび未観測タスクの両方の適応を可能にし、ゼロショットまたはフェイシュット一般化を実現する。
  • 一般化性能と安定性を多様なフェイシュットNLPタスクで評価するために、インセンティブプロンプトチューニング(IPT)パイプラインを適用する。
  • 部分空間構造を活用して、プロンプトチューニングの最適化複雑性を低減し、収束安定性を向上させる。

実験結果

リサーチクエスチョン

  • RQ1多様なNLPタスクへの事前学習言語モデルの適応を、低次元の内在タスク部分空間に再パラメータ化可能か?
  • RQ21つの共有低次元部分空間が、フェイシュットデータを用いて未観測NLPタスクにどの程度一般化できるか?
  • RQ3内在部分空間内でわずか数パラメータをチューニングすることで、フルプロンプトチューニングの性能をどの程度回復できるか?
  • RQ4最適化を内在部分空間に制限することで、プロンプトチューニングの安定性が向上するか?

主な発見

  • 100の多様なNLPタスクから学習された5次元の内在タスク部分空間は、観測済みおよび未観測タスクの両方への効果的適応を可能にする。
  • 内在部分空間内で5つのパラメータのみをチューニングすることで、IPTは100の観測済みタスクでフルプロンプトチューニング性能の87%を達成した。
  • 20の未観測タスクでは、IPTはフルプロンプトチューニング性能の65%を達成し、優れた一般化性能を示した。
  • 内在タスク部分空間は、プロンプトチューニングの安定性を顕著に向上させ、最適化の分散を低減した。
  • この手法により、多様なタスクへのPLM適応が本質的に低次元で普遍的な部分空間に制限されることを明らかにした。
  • 部分空間はタスク間で普遍的な適応パターンを捉えており、PLMファインチューニングにおける共通のインダクティブバイアスの存在を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。