[論文レビュー] Few-Shot Parameter-Efficient Fine-Tuning is Better and Cheaper than In-Context Learning
この論文は、少数ショットのパラメータ効率的微調整(PEFT)、特にT-Fewレシピと組み合わせた新しいIA3ベースの手法が、精度においては文脈依存学習(ICL)を上回り、計算・メモリ・ストレージコストを劇的に削減することを示し、RAFTで超人間レベルの性能も達成します。
Few-shot in-context learning (ICL) enables pre-trained language models to perform a previously-unseen task without any gradient-based training by feeding a small number of training examples as part of the input. ICL incurs substantial computational, memory, and storage costs because it involves processing all of the training examples every time a prediction is made. Parameter-efficient fine-tuning (PEFT) (e.g. adapter modules, prompt tuning, sparse update methods, etc.) offers an alternative paradigm where a small set of parameters are trained to enable a model to perform the new task. In this paper, we rigorously compare few-shot ICL and PEFT and demonstrate that the latter offers better accuracy as well as dramatically lower computational costs. Along the way, we introduce a new PEFT method called (IA)$^3$ that scales activations by learned vectors, attaining stronger performance while only introducing a relatively tiny amount of new parameters. We also propose a simple recipe based on the T0 model called T-Few that can be applied to new tasks without task-specific tuning or modifications. We validate the effectiveness of T-Few on completely unseen tasks by applying it to the RAFT benchmark, attaining super-human performance for the first time and outperforming the state-of-the-art by 6% absolute. All of the code used in our experiments is publicly available.
研究の動機と目的
- データが非常に限られたラベル付きデータで新しいタスクへ適応させる際の、ICLに代わるデータ効率的なアプローチを動機づける。
- 混在タスク推論に拡張可能で、最小限のパラメータ更新を要する concrete PEFTベースのレシピを提案する。
- トレーニング objectiveをランキングベースの評価とより整合させる追加損失項で、少数ショットの性能を向上させる。
提案手法
- ベースモデルとしてT0-3Bを使用し、新しいPEFT手法(IA)3)を適用して、選択的な活性化を乗法的に調整する。
- 層ごとにキ―のスケーリング、値、フィードフォワード活性化を再スケールするために3つの学習ベクトル(l_k, l_v, l_ff)を導入する。
- 正解の選択肢のランキングを改善し、誤った選択肢を抑制することを目的とした結合目的関数L = L_LM + L_UL + L_LNで訓練する。
- IA3パラメータをT0で使用されたマルチタスク混合データで事前学習し、その後下流タスクで微調整する。
- 固定プロンプティングテンプレート(P3)を適用し、Adafactorを用いて1,000ステップ訓練を行い、タスク間でハイパーパラメータの微調整を行わずに均一なレシピを適用する。
実験結果
リサーチクエスチョン
- RQ1IA3のような軽量な活性化ベースの適応を用いたPEFTは、少数ショット設定でフルモデル微調整と同等以上を達成できるか。
- RQ2T-Fewレシピは未知のタスクにも汎用性を持ち、少数のラベル付きデータセットで混在タスク推論を可能にするか。
- RQ3追加の損失項(非尤度と長さ正規化)は少数ショット学習の性能にどのように影響するか。
- RQ4タスク間での比較におけるT-FewとICLの計算量・メモリ・ストレージコストはどう異なるか。
- RQ5RAFTのような実世界の少数ショットベンチマークでこのアプローチは効果的か。
主な発見
- T-Fewは、GPT-3系を含む強力なICLベースラインを一貫して上回り、保持されたT0タスクで優れた成績を示した。
- T-Fewは保持タスクで72.4%の精度を達成し、GPT-3 175Bの66.6%、T0の66.9%を上回る。
- RAFTでは、T-Fewは75.8%の精度に達し、人間のベースラインである73.5%を上回る。
- IA3は、試験されたPEFT手法の中で、完全モデル微調整を超える精度を達成しつつ、更新パラメータ数を最大で約10,000倍も削減する唯一の方法だった。
- T-Few(IA3)の訓練はディスク上で約4.2 MBを追加する一方、推論コストはICLよりはるかに低く、GPT-3 175Bの41ショット文脈でのFLOPsコストは1e15を超える。
- IA3パラメータをタスク固有の微調整前に事前訓練することで、精度が向上する(64.6から65.8へ)。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。