Skip to main content
QUICK REVIEW

[論文レビュー] HyperTuning: Toward Adapting Large Language Models without Back-propagation

Jason Phang, Yi Mao|arXiv (Cornell University)|Nov 22, 2022
Topic Modeling被引用数 9
ひとこと要約

HyperTuningは、バックプロパゲーションを用いずに大規模言語モデルを適応させるための新しいパラダイムを導入する。少数のショット例を入力として受け取り、1回のフォワードパスでタスク固有のパラメータ更新(例:ソフトプレフィックスやLoRAアダプタ)を生成するハイパーモデルを用いる。この手法は、未学習のタスクにおいて強力なゼロショット性能を達成し、ハイパーモデルが生成したパラメータを初期値として使用することで、後続のPEFT微調整の効率と性能を向上させる。バックプロパゲーションを伴わない効率的なモデル適応への有望な道筋を示している。

ABSTRACT

Fine-tuning large language models for different tasks can be costly and inefficient, and even methods that reduce the number of tuned parameters still require full gradient-based optimization. We propose HyperTuning, a novel approach to model adaptation that uses a hypermodel to generate task-specific parameters for a fixed downstream model. We demonstrate a simple setup for hypertuning with HyperT5, a T5-based hypermodel that produces soft prefixes or LoRA parameters for a frozen T5 model from few-shot examples. We train HyperT5 in two stages: first, hyperpretraining with a modified conditional language modeling objective that trains a hypermodel to generate parameters; second, multi-task fine-tuning (MTF) on a large number of diverse language tasks. We evaluate HyperT5 on P3, MetaICL and Super-NaturalInstructions datasets, and show that it can effectively generate parameters for unseen tasks. Moreover, we show that using hypermodel-generated parameters as initializations for further parameter-efficient fine-tuning improves performance. HyperTuning can thus be a flexible and efficient way to leverage large language models for diverse downstream applications.

研究の動機と目的

  • 大規模言語モデルの微調整におけるバックプロパゲーションの高い計算コストを軽減すること。
  • 主モデルの勾配計算を必要とせずに、分離されたハイパーモデルが効果的なパラメータ更新を生成できるかを検証すること。
  • ハイパーモデルが生成したパラメータが、さらなるパラメータ効率の良い微調整のための優れた初期値として機能するかを評価すること。
  • ハイパープレトレーニングとマルチタスク微調整を用いた2段階訓練手順の実現可能性を示すこと。

提案手法

  • ハイパーモデル(HyperT5)を訓練し、固定されたT5ベースの下流モデルに対して、タスク固有のPEFTパラメータ(例:ソフトプレフィックスやLoRA行列)を生成する。
  • ハイパーモデルは、有効なPEFTパラメータをショット例から生成できるように、変更された条件付き言語モデル学習目的を用いてまずハイパープレトレーニングを行う。
  • その後、1,000以上の多様な言語タスク上でマルチタスク微調整(MTF)を実施し、一般化性能と転送可能性を向上させる。
  • 推論時、ハイパーモデルはわずかなショット例のみを入力とし、1回のフォワードパスでPEFTパラメータを出力する。
  • 生成されたパラメータを用いて、主モデルのバックプロパゲーションを一切行わず、固定されたT5モデルを適応させる。
  • ハイパーモデルが生成したパラメータを、標準的なPEFT手法(例:プレフィックスチューニングやLoRA)の初期値としてさらに評価する。

実験結果

リサーチクエスチョン

  • RQ1主言語モデルのバックプロパゲーションを必要とせずに、ハイパーモデルが未学習の下流タスク用に効果的なPEFTパラメータを生成できるか?
  • RQ2ハイパープレトレーニングに続くマルチタスク微調整という2段階訓練手順が、ハイパーモデルの一般化性能と性能を向上させるか?
  • RQ3ハイパーモデルが生成したパラメータは、その後のPEFT微調整の初期値として、ランダム初期化や共有MTF初期化よりも優れているか?
  • RQ4ハイパータイニングモデルの性能は、ゼロショットおよびショットベンチマークにおいて、標準的なPEFTおよびフル微調整と比べてどうか?

主な発見

  • HyperT5は、ハイパーモデルが生成したパラメータを用いたプレフィックスチューニングで、P3の保留タスクにおいて平均75.2%の精度を達成し、ランダム初期化および共有MTF初期化を上回った。
  • PEFTの初期値として使用された場合、ハイパーモデルが生成したパラメータは、P3タスクにおけるLoRAチューニングで平均75.0%の精度を達成し、収束が速く、性能も高いことがわかった。
  • ハイパーモデルが生成した初期値は、ランダムまたは共有初期値よりも著しく高い初期性能を示し、訓練プロセス全体にわたり優位性を維持した。
  • Super-NaturalInstructionsおよびMetaICLベンチマークにおいて、HyperT5は未学習のタスクに対して効果的なPEFTパラメータを生成でき、強力なゼロショット一般化性能を示した。
  • ハイパープレトレーニングに続くマルチタスク微調整という2段階訓練手順は、ハイパーモデルが多様な下流タスクに一般化できるように効果的であることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。