Skip to main content
QUICK REVIEW

[論文レビュー] ATTEMPT: Parameter-Efficient Multi-task Tuning via Attentional Mixtures of Soft Prompts

Akari Asai, Mohammadreza Salehi|arXiv (Cornell University)|May 24, 2022
Domain Adaptation and Few-Shot Learning被引用数 16
ひとこと要約

ATTEMPTは、高リソースなソースタスクからのソフトプロンプトを動的に組み合わせるアテンションメカニズムを用いた、パrameter効率の良いマルチタスクチューニング手法を提案する。言語モデルは凍結されたままであり、全微調整と比較して更新パラメータの0.4%にとどまる。21のNLPデータセットで最先端の性能を達成し、プロンプトチューニングを著しく上回り、完全微調整モデルと同等の性能を発揮するが、非常に効率的でモジュール性が高い。

ABSTRACT

This work introduces a new multi-task, parameter-efficient language model (LM) tuning method that learns to transfer knowledge across different tasks via a mixture of soft prompts-small prefix embedding vectors pre-trained for different tasks. Our method, called ATTEMPT (ATTEntional Mixtures of Prompt Tuning), obtains source prompts as encodings of large-scale source tasks into a small number of parameters and trains an attention module to interpolate the source prompts and a newly initialized target prompt for every instance in the target task. During training, only the target task prompt and the attention weights, which are shared between tasks in multi-task training, are updated, while the original LM and source prompts are intact. ATTEMPT is highly parameter-efficient (e.g., updates 2,300 times fewer parameters than full fine-tuning) while achieving high task performance using knowledge from high-resource tasks. Moreover, it is modular using pre-trained soft prompts, and can flexibly add or remove source prompts for effective knowledge transfer. Our experimental results across 21 diverse NLP datasets show that ATTEMPT significantly outperforms prompt tuning and outperforms or matches fully fine-tuned or other parameter-efficient tuning approaches that use over ten times more parameters. Finally, ATTEMPT outperforms previous work in few-shot learning settings.

研究の動機と目的

  • 全微調整に比べてパラメータ効率が低く、知識の転送が限定される既存のパrameter効率の良いチューニング手法が、ターゲットタスクのデータにのみ依存する問題を解決すること。
  • 言語モデルを微調整せずに、高リソースなソースタスクから低リソースなターゲットタスクへの効果的な知識転送を可能にすること。
  • 事前学習済みのソフトプロンプトを用いたマルチタスク学習のためのモジュラーで解釈可能かつ再利用可能なフレームワークを構築すること。
  • さまざまなNLPタスク、特に少サンプル設定において、パラメータの更新を減らしつつ、性能を維持または向上させること。
  • タスクの類似性に関する事前計算済みの事前分布に依存せずに、関連するソースタスクを特定するアテンション重みを学習することで、その必要性を排除すること。

提案手法

  • 大規模なソースタスクでソフトプロンプトを事前学習し、再利用可能で転送可能なプロンプト埋め込みを生成する。
  • ターゲットタスク固有の新しいソフトプロンプトを初期化し、アテンションメカニズムとともに学習する。
  • 各入力トークンに対して、ソースプロンプトとターゲットプロンプトのインスタンスごとの重み付き組み合わせを計算するための軽量で共有されたアテンションネットワークを用いる。
  • トレーニング中に言語モデルとソースプロンプトは凍結したまま、ターゲットプロンプトと共有アテンション重みのみを更新する。
  • アテンション重み付きプロンプト混合を入力シーケンスのプレフィックスとして適用し、それらを凍結された言語モデルが処理する。
  • 1つの凍結されたモデルに複数の事前にロードされたソフトプロンプトを用いて推論を可能にし、再トレーニングなしにマルチタスク推論をサポートする。

実験結果

リサーチクエスチョン

  • RQ1パラメータ効率の良い手法として、複数の高リソースなソースタスクから低リソースなターゲットタスクへの知識転送を、言語モデルを微調整せずに効果的に行えるか。
  • RQ2アテンションベースのソフトプロンプト混合は、標準的なプロンプトチューニングや完全微調整と比較して、性能とパラメータ効率の面でどのように差をつけるか。
  • RQ3事前計算済みの事前分布に依存せずに、アテンションメカニズムが意味のあるタスク類似性を学習し、関連するソースタスクに焦点を当けることができるか。
  • RQ4モジュラーなプロンプト構成は、マルチタスク学習における性能と柔軟性をどの程度向上させるか。
  • RQ5本手法は、少サンプル学習や低リソース設定においてどの程度効果的か。

主な発見

  • ATTEMPTは21の多様なNLPデータセットにおいて、プロンプトチューニングを著しく上回り、全微調整と比較して更新パラメータが0.4%のわずかで、最先端の性能を達成した。
  • 本手法は、全微調整モデルや10倍以上のパラメータを更新する他のパラメータ効率の良い手法と同等またはそれを上回る性能を発揮した。
  • 少サンプル学習設定(4~32ショット)においても、ATTEMPTは一貫してベースラインを上回り、優れた一般化能力を示した。
  • アブレーションスタディの結果、学習されたアテンション重み、マルチタスク学習、複数のソースタスクからのモジュラー転送が、性能向上の主な要因であることが確認された。
  • アテンション分布は、帰属関係(例:自然言語の帰属と同義語検出の間)のような意味のあるタスク類似性を示しており、効果的な知識転送が行われていることを裏付けた。
  • 本手法は非常にパラメータ効率が高く、特にバックボーンモデルが大きくなると、他のパラメータ効率の良い手法がトレーナブルパラメータを急増させるのとは対照的に、その利点が顕著に現れた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。