Skip to main content
QUICK REVIEW

[論文レビュー] Few-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than In-Context Learning

Haokun Liu, Derek Tam|arXiv (Cornell University)|May 11, 2022
Topic Modeling被引用数 292
ひとこと要約

この論文は、少数ショットのパラメータ効率的微調整(PEFT)、特にT-Fewレシピと組み合わせた新しいIA3ベースの手法が、精度においては文脈依存学習(ICL)を上回り、計算・メモリ・ストレージコストを劇的に削減することを示し、RAFTで超人間レベルの性能も達成します。

ABSTRACT

Few-shot in-context learning (ICL) enables pre-trained language models to perform a previously-unseen task without any gradient-based training by feeding a small number of training examples as part of the input. ICL incurs substantial computational, memory, and storage costs because it involves processing all of the training examples every time a prediction is made. Parameter-efficient fine-tuning (PEFT) (e.g. adapter modules, prompt tuning, sparse update methods, etc.) offers an alternative paradigm where a small set of parameters are trained to enable a model to perform the new task. In this paper, we rigorously compare few-shot ICL and PEFT and demonstrate that the latter offers better accuracy as well as dramatically lower computational costs. Along the way, we introduce a new PEFT method called (IA)$^3$ that scales activations by learned vectors, attaining stronger performance while only introducing a relatively tiny amount of new parameters. We also propose a simple recipe based on the T0 model called T-Few that can be applied to new tasks without task-specific tuning or modifications. We validate the effectiveness of T-Few on completely unseen tasks by applying it to the RAFT benchmark, attaining super-human performance for the first time and outperforming the state-of-the-art by 6% absolute. All of the code used in our experiments is publicly available.

研究の動機と目的

  • データが非常に限られたラベル付きデータで新しいタスクへ適応させる際の、ICLに代わるデータ効率的なアプローチを動機づける。
  • 混在タスク推論に拡張可能で、最小限のパラメータ更新を要する concrete PEFTベースのレシピを提案する。
  • トレーニング objectiveをランキングベースの評価とより整合させる追加損失項で、少数ショットの性能を向上させる。

提案手法

  • ベースモデルとしてT0-3Bを使用し、新しいPEFT手法(IA)3)を適用して、選択的な活性化を乗法的に調整する。
  • 層ごとにキ―のスケーリング、値、フィードフォワード活性化を再スケールするために3つの学習ベクトル(l_k, l_v, l_ff)を導入する。
  • 正解の選択肢のランキングを改善し、誤った選択肢を抑制することを目的とした結合目的関数L = L_LM + L_UL + L_LNで訓練する。
  • IA3パラメータをT0で使用されたマルチタスク混合データで事前学習し、その後下流タスクで微調整する。
  • 固定プロンプティングテンプレート(P3)を適用し、Adafactorを用いて1,000ステップ訓練を行い、タスク間でハイパーパラメータの微調整を行わずに均一なレシピを適用する。

実験結果

リサーチクエスチョン

  • RQ1IA3のような軽量な活性化ベースの適応を用いたPEFTは、少数ショット設定でフルモデル微調整と同等以上を達成できるか。
  • RQ2T-Fewレシピは未知のタスクにも汎用性を持ち、少数のラベル付きデータセットで混在タスク推論を可能にするか。
  • RQ3追加の損失項(非尤度と長さ正規化)は少数ショット学習の性能にどのように影響するか。
  • RQ4タスク間での比較におけるT-FewとICLの計算量・メモリ・ストレージコストはどう異なるか。
  • RQ5RAFTのような実世界の少数ショットベンチマークでこのアプローチは効果的か。

主な発見

  • T-Fewは、GPT-3系を含む強力なICLベースラインを一貫して上回り、保持されたT0タスクで優れた成績を示した。
  • T-Fewは保持タスクで72.4%の精度を達成し、GPT-3 175Bの66.6%、T0の66.9%を上回る。
  • RAFTでは、T-Fewは75.8%の精度に達し、人間のベースラインである73.5%を上回る。
  • IA3は、試験されたPEFT手法の中で、完全モデル微調整を超える精度を達成しつつ、更新パラメータ数を最大で約10,000倍も削減する唯一の方法だった。
  • T-Few(IA3)の訓練はディスク上で約4.2 MBを追加する一方、推論コストはICLよりはるかに低く、GPT-3 175Bの41ショット文脈でのFLOPsコストは1e15を超える。
  • IA3パラメータをタスク固有の微調整前に事前訓練することで、精度が向上する(64.6から65.8へ)。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。