[論文レビュー] On Transferability of Prompt Tuning for Natural Language Understanding
本稿は、自然言語理解におけるプロンプトチューニング(PT)の転送可能性を調査し、あるタスクで訓練されたソフトプロンプトが、類似した下流タスクにおけるPTの性能向上と高速化に寄与することを示している。プロンプト類似度、特に活性化されたニューロンの重複が、転送可能性と強く相関していることが判明した。一方、タスク間での転送は効果的であるが、最適化の違いやモデルの冗長性のため、モデル間での転送はそれほど効果的ではない。
Prompt tuning (PT) is a promising parameter-efficient method to utilize extremely large pre-trained language models (PLMs), which could achieve comparable performance to full-parameter fine-tuning by only tuning a few soft prompts. However, compared to fine-tuning, PT empirically requires much more training steps. To explore whether we can improve the efficiency of PT by reusing trained soft prompts and sharing learned knowledge, we empirically investigate the transferability of soft prompts across different tasks and models. In cross-task transfer, we find that trained soft prompts can well transfer to similar tasks and initialize PT for them to accelerate training and improve performance. Moreover, to explore what factors influence prompts' transferability across tasks, we investigate how to measure the prompt similarity and find that the overlapping rate of activated neurons highly correlates to the transferability. In cross-model transfer, we explore how to project the prompts of a PLM to another PLM and successfully train a kind of projector which can achieve non-trivial transfer performance on similar tasks. However, initializing PT with the projected prompts does not work well, which may be caused by optimization preferences and PLMs' high redundancy. Our findings show that improving PT with knowledge transfer is possible and promising, while prompts' cross-task transferability is generally better than the cross-model transferability.
研究の動機と目的
- あるタスクで訓練されたソフトプロンプトが、類似した下流タスクにおけるプロンプトチューニングの加速と改善に寄与するかどうかを調査すること。
- 異なる自然言語理解タスク間でのソフトプロンプトの転送可能性に影響を与える要因を同定すること。
- 射影機構を介して、異なる事前学習言語モデル(PLM)間でのプロンプトの転送可能性を検討すること。
- 転送されたプロンプトでプロンプトチューニングを初期化することで、訓練の効率性とパフォーマンスが向上するかどうかを評価すること。
- ニューロン活性化の重複と最適化の好みが、プロンプト転送可能性を決定づける役割を分析すること。
提案手法
- 複数のNLUタスクにおいて、ソースタスクで微調整されたソフトプロンプトを用いて、プロンプトチューニングの転送可能性を実証的に評価する。
- PLMの隠れ層における活性化されたニューロンの重複率を用いて、プロンプト類似度を測定する。
- ソフトプロンプトを1つのPLMから別のPLMにマッピングするためのプロジェクターネットワークを訓練する。
- 異なるPLMからのプロジェクタードプロンプトを用いてターゲットタスクでのプロンプトチューニングを初期化し、収束速度とパフォーマンスをランダム初期化と比較する。
- 最適化ダイナミクスとモデル固有の好みを分析し、モデル間転送におけるパフォーマンスギャップを説明する。
- 標準的なNLUベンチマーク(例:GLUE)を用いて、多様なタスクとモデルアーキテクチャで転送パフォーマンスを評価する。
実験結果
リサーチクエスチョン
- RQ1あるNLUタスクで訓練されたソフトプロンプトが、異なるが類似したタスクにおけるプロンプトチューニングの加速に効果的に転送可能か?
- RQ2ニューロン活性化パターンなどの要因が、タスク間でのソフトプロンプトの転送可能性にどのように影響を与えるか?
- RQ3射影機構を用いて、異なる事前学習言語モデル間でソフトプロンプトをどの程度転送可能か?
- RQ4異なるPLMからの転送プロンプトでプロンプトチューニングを初期化することで、ランダム初期化と比較して収束が速くなり、パフォーマンスが向上するか?
- RQ5射影に成功しているにもかかわらず、モデル間でのプロンプト転送がタスク間転送に比べて性能が低いのはなぜか?
主な発見
- 訓練済みのソフトプロンプトは、類似した下流タスクへの転送が効果的であり、プロンプトチューニングの収束を顕著に加速し、パフォーマンスを向上させる。
- PLMの隠れ層における活性化されたニューロンの重複率は、タスク間でのプロンプト転送可能性と強く正の相関を示す。
- プロジェクターネットワークを用いることで、1つのPLMから別のPLMへのソフトプロンプトのマッピングが成功し、類似したタスクで非自明な転送パフォーマンスが達成できる。
- 異なるPLMからのプロジェクタードプロンプトでプロンプトチューニングを初期化しても、パフォーマンスの向上が得られない。これは、最適化の好みの不一致とモデル固有の冗長性のためと推測される。
- タスク間での転送可能性は、モデル間での転送可能性よりも一貫して高い。これは、タスクの類似性が、モデルの互換性よりも成功の決定要因であることを示唆している。
- 結果から、ソフトプロンプトによる知識転送は、同じモデルファミリー内やタスク分布内での転送が、異なるモデル間での転送よりも効果的であることが示唆される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。