Skip to main content
QUICK REVIEW

[論文レビュー] A Kernel-Based View of Language Model Fine-Tuning

Sadhika Malladi, Alexander Wettig|arXiv (Cornell University)|Oct 11, 2022
Topic Modeling被引用数 6
ひとこと要約

本稿は、大規模言語モデル(LM)の微調整の成功を理論的に説明するためのカーネルベースのフレームワークを導入する。微調整のダイナミクスがAdam最適化とプロンプトを用いる場合、しばしばニューラルタングエント・カーネル(NTK)の挙動に従うことが示され、プロンプトがカーネルに類似した最適化を誘発することを証明している。さらに、LoRAのようなパラメータ効率の良い手法がカーネル構造を保持することを示し、最小限のパラメータ更新で効果を発揮する理由を説明する。

ABSTRACT

It has become standard to solve NLP tasks by fine-tuning pre-trained language models (LMs), especially in low-data settings. There is minimal theoretical understanding of empirical success, e.g., why fine-tuning a model with $10^8$ or more parameters on a couple dozen training points does not result in overfitting. We investigate whether the Neural Tangent Kernel (NTK) - which originated as a model to study the gradient descent dynamics of infinitely wide networks with suitable random initialization - describes fine-tuning of pre-trained LMs. This study was inspired by the decent performance of NTK for computer vision tasks (Wei et al., 2022). We extend the NTK formalism to Adam and use Tensor Programs (Yang, 2020) to characterize conditions under which the NTK lens may describe fine-tuning updates to pre-trained language models. Extensive experiments on 14 NLP tasks validate our theory and show that formulating the downstream task as a masked word prediction problem through prompting often induces kernel-based dynamics during fine-tuning. Finally, we use this kernel view to propose an explanation for the success of parameter-efficient subspace-based fine-tuning methods.

研究の動機と目的

  • 少数のサンプルデータに対する大規模言語モデルの微調整が、高容量にもかかわらず過学習を示さない理由を理解すること。
  • 特に、カーネルに類似した最適化ダイナミクスを誘発するという観点から、プロンプトの微調整における経験的成果を説明すること。
  • ニューラルタングエント・カーネル(NTK)フレームワークをAdam最適化および非確率的(事前学習済み)の重み初期化に理論的に拡張すること。
  • LoRAのようなパラメータ効率の良い微調整手法の理論的基盤を、そのカーネル行動の分析を通じて提供すること。
  • 14の多様なNLPタスクにわたる実験的検証を通じて、カーネルダイナミクスが発生する条件を同定すること。

提案手法

  • 勾配の符号に基づくカーネル式を導入することで、標準的なNTK形式をAdam最適化に拡張し、初期段階の訓練ダイナミクスをモデル化する。
  • Tensor Programsフレームワークを用いて、事前学習済みで非i.i.d.な初期化を持つ無限幅ネットワークを分析し、非確率的重みを用いた微調整の理論的分析を可能にする。
  • 事前学習済みモデルのパラメータからの勾配を用いて、微調整中のカーネルダイナミクスを表す、実効的NTK(eNTK)を定義する。
  • 無限幅極限における勾配ダイナミクスの分析を通じて、プロンプトベースの微調整がTransformerにカーネル行動を誘発することを形式的に証明する。
  • Johnson-Lindenstraussの補題を適用し、低ランクパラメータ更新(例:LoRA)が高確率でカーネル構造を保持することを示す。
  • LoRAにおけるSGD誘発カーネルの閉形式表現を導出し、全微調整カーネルと比較することで、穏やかな仮定の下で両者の類似性を証明する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み言語モデルの微調整が、特にAdam最適化下で、どのような条件下でカーネルベースのダイナミクスを示すか。
  • RQ2プロンプトは、大規模モデルの微調整において、カーネル行動の出現にどのように寄与するか。
  • RQ3LoRAのようなパラメータ効率の良い微調整手法の成功は、カーネルベースの視点から説明可能か。
  • RQ4eNTKは、多様なNLPタスクにわたる微調整ダイナミクスをどの程度正確に記述するか。
  • RQ5LoRAの勾配ダイナミクスは、全微調整と比較して、どの程度カーネル類似性を示すか。

主な発見

  • プロンプトベースの微調整は、14のNLPタスクにわたるeNTK予測と実際の微調整性能との間で強い一致を示すなど、一貫してカーネルに類似したダイナミクスを誘発する。
  • eNTKは、画像タスク(先行研究より)で全微調整の分類精度の6%以内に達し、このカーネルベースの挙動はNLPでも再現され、言語モデルへの一般化を裏付ける。
  • ランク$k$が$k \geq \Theta(Lc^4 \log N / \epsilon^2)$を満たす限り、LoRAのカーネルは高確率で全微調整カーネルと非常に類似していることが示された。ここで$L$はLoRAレイヤー数を表す。
  • 理論的分析により、非確率的で事前学習済みの重みを用いても、プロンプトがTransformerにおける明確なカーネル行動のメカニズムを誘発することが証明された。
  • 実験的結果から、プロンプトが意味を持つ場合にカーネルダイナミクスが顕著に現れることを示し、ランダムなプロンプトでは安定したカーネル行動が誘発されないことが分かった。
  • カーネル視点により、パラメータ効率の良い手法の成功が統一的に説明できる:これらは、全微調整の本質的な勾配構造を保持しながら、パラメータ更新を削減する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。