Skip to main content
QUICK REVIEW

[論文レビュー] In-Context Learning Creates Task Vectors

Roee Hendel, Mor Geva|arXiv (Cornell University)|Oct 24, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、大規模言語モデル(LLMs)における文脈内学習(ICL)が、デモンストレーションを1つのタスクベクトルに圧縮し、そのベクトルがクエリの出力を調整するメカニズムとして機能することを提案する。著者らは、ICLがタスクルールを捉えるタスクベクトルを学習する仮説クラス学習メカニズムとして見なせることを示しており、デモンストレーションへの直接アクセスがなくても正確な予測が可能である。この主張は、複数のモデルとタスクにおいて実証的に検証されている。

ABSTRACT

In-context learning (ICL) in Large Language Models (LLMs) has emerged as a powerful new learning paradigm. However, its underlying mechanism is still not well understood. In particular, it is challenging to map it to the "standard" machine learning framework, where one uses a training set $S$ to find a best-fitting function $f(x)$ in some hypothesis class. Here we make progress on this problem by showing that the functions learned by ICL often have a very simple structure: they correspond to the transformer LLM whose only inputs are the query $x$ and a single "task vector" calculated from the training set. Thus, ICL can be seen as compressing $S$ into a single task vector $\boldsymbolθ(S)$ and then using this task vector to modulate the transformer to produce the output. We support the above claim via comprehensive experiments across a range of models and tasks.

研究の動機と目的

  • 大規模言語モデル(LLMs)における文脈内学習(ICL)の背後にあるメカニズムを理解すること。これは、その実証的成功にもかかわらず、依然として十分に解明されていない。
  • ICLを形式的な学習理論的枠組みにマッピングすること。具体的には、ICLが作用する仮説クラスを同定すること。
  • ICLが、デモンストレーションからタスクベクトルを学習する段階と、その後にクエリにそれを適用する段階に分解可能かどうかを調査すること。
  • タスクベクトルが、入力のデモンストレーションとは独立して、意味的で解釈可能なタスク固有の情報を保持しているかどうかを検証すること。
  • このメカニズムが、新しいタスクへの効率的かつ解釈可能なLLMの適応に与えるインパクトを探ること。

提案手法

  • デモンストレーション S から得られるタスクベクトル θ(S) を、クエリ x とは独立して学習する仮説クラスの視点を提案する。
  • 2段階のメカニズムを定義する:(1) S から θ(S) を計算する「学習アルゴリズム」𝒜 と、(2) θ(S) と x を使って出力を生成する「ルール適用」f。この際、S への直接アクセスは不要である。
  • デコーダー専用のトランスフォーマーにおけるアテンションメカニズムを用いて、S と x を処理した後の隠れ状態表現としてタスクベクトルを抽出する。
  • 線形投影を用いてタスクベクトルを語彙空間に射影し、その意味的コンテンツを解釈可能にする。
  • 翻訳、語義の意味解釈、算術的推論など、多様なNLPタスクでこの手法を訓練および評価する。
  • 標準的なICLおよびベースラインモデルと比較することで、有効性と一般化性能を検証する。
Figure 1: ICL as learning in a Hypothesis Class. In ICL, one provides an LLM with a prompt including demonstrations $S$ of some task, and a query $x$ . The model generates the output for $x$ (here “Yellow”). We show that the underlying process can be broken down into two parts: $\mathcal{A}$ , a “le
Figure 1: ICL as learning in a Hypothesis Class. In ICL, one provides an LLM with a prompt including demonstrations $S$ of some task, and a query $x$ . The model generates the output for $x$ (here “Yellow”). We show that the underlying process can be broken down into two parts: $\mathcal{A}$ , a “le

実験結果

リサーチクエスチョン

  • RQ1LLMsにおける文脈内学習は、デモンストレーション S から得られる1つのタスクベクトル θ(S) がルールを符号化する仮説クラス学習メカニズムとして形式化可能か?
  • RQ2タスクベクトル θ(S) はクエリ x に依存せず、S を再処理せずに新たなクエリに適用可能か?
  • RQ3タスクベクトル θ(S) は、タスク固有の用語が入力に存在しない場合でも、意味的で解釈可能な意味情報を保持しているか?
  • RQ4異なるモデルやタスクにわたって、タスクベクトルアプローチが一般化可能で、高い正確性を維持できるか?
  • RQ5多様なタスクにおいて、タスクベクトルベースの手法の性能は、標準的なICLおよびベースラインモデルと比べてどうか?

主な発見

  • タスクベクトル θ(S) は、デモンストレーション S に内在するルールを効果的に捉えており、S への直接アクセスがなくても未観測のクエリに対して正確な予測を可能にした。
  • 翻訳タスクでは、タスクベクトルを用いたモデルが96%の正確度を達成し、少数ショット例からの強力な一般化を示した。
  • フランス語→英語翻訳タスクにおけるタスクベクトルの投影で上位を占めるトークンには「English」と「translate」が含まれており、ベクトルが入力に存在しないタスク固有の意味情報を符号化していることが示された。
  • 「Present to Past」タスクでは95%の正確度を達成し、多様な言語的変換に対して堅牢な性能を示した。
  • モデル間でも一般化が成立し、LLaMA 13B、GPT-3 など複数のモデルで、さまざまなタスクで良好な結果が得られた。
  • タスクベクトルアプローチは、ICLの機械的解釈を提供し、LLMsがデモンストレーションを1つの解釈可能なベクトルに圧縮し、モデルの挙動を調整していることを示唆している。
Figure 2: Separating $\mathcal{A}$ and $f$ . To make $\boldsymbol{\theta}$ independent of the query $x$ , we use a dummy query ( $x^{\prime}=\mbox{Plum}$ ) and use the representation of $\rightarrow$ at the $L^{th}$ layer as $\boldsymbol{\theta}$ . The vector $\boldsymbol{\theta}$ is then patched at
Figure 2: Separating $\mathcal{A}$ and $f$ . To make $\boldsymbol{\theta}$ independent of the query $x$ , we use a dummy query ( $x^{\prime}=\mbox{Plum}$ ) and use the representation of $\rightarrow$ at the $L^{th}$ layer as $\boldsymbol{\theta}$ . The vector $\boldsymbol{\theta}$ is then patched at

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。