[論文レビュー] A Theory of Emergent In-Context Learning as Implicit Structure Induction
本論文は、大規模言語モデルにおける文脈内学習(ICL)が、事前学習データにおける構成的演算を通じた暗黙の構造誘導に起因すると提案する。言語を構成的文法として形式化し、情報理論的境界を導出することで、著者らは、データに十分な構造的多様性が存在する場合、次トークン予測のみでICLが発現することを示した。これは、スケールに伴いICLが出現し、チェーン・オブ・トゥー(chain-of-thought)プロンプトによって向上する、制御された設定で検証された。
Scaling large language models (LLMs) leads to an emergent capacity to learn in-context from example demonstrations. Despite progress, theoretical understanding of this phenomenon remains limited. We argue that in-context learning relies on recombination of compositional operations found in natural language data. We derive an information-theoretic bound showing how in-context learning abilities arise from generic next-token prediction when the pretraining distribution has sufficient amounts of compositional structure, under linguistically motivated assumptions. A second bound provides a theoretical justification for the empirical success of prompting LLMs to output intermediate steps towards an answer. To validate theoretical predictions, we introduce a controlled setup for inducing in-context learning; unlike previous approaches, it accounts for the compositional nature of language. Trained transformers can perform in-context learning for a range of tasks, in a manner consistent with the theoretical results. Mirroring real-world LLMs in a miniature setup, in-context learning emerges when scaling parameters and data, and models perform better when prompted to output intermediate steps. Probing shows that in-context learning is supported by a representation of the input's compositional structure. Taken together, these results provide a step towards theoretical understanding of emergent behavior in large language models.
研究の動機と目的
- 大規模言語モデルにおける発現的文脈内学習(ICL)の理論的基盤を構築すること。
- 特化したファインチューニングなしにICLがなぜ一般の次トークン予測から生じるのかを説明すること。
- ICLの広範な能力を可能にする構成的構造の役割を形式化すること。
- 実世界のLLM行動を模倣する、言語的に動機付けられた制御された実験設定を通じて理論を検証すること。
- 理論的境界を用いてチェーン・オブ・トゥー(chain-of-thought)プロンプティングの実証的成功を説明すること。
提案手法
- 理論的分析により、言語的に動機付けられた仮定の下で、事前学習データに十分な構成的構造が存在する場合、ICLが発生することを示す情報理論的境界が導出された。
- 第一階論理とHMMを用いて、構造的多様性の異なる量を持つ構成的データ生成を模倣する、新しい制御されたデータセットが構築された。
- タスクは論理的ワールドモデルで定義され、LMはオブジェクト集合 $|Ω|$ と関数 $|ℜ|$ の制御された変動を伴う構成的テキストで学習された。
- 中間ステップのプロンプティング(チェーン・オブ・トゥー)がICLパフォーマンスを向上させる理由を説明する理論的境界が導出された。
- プロービング実験により、表現が構成的構造をエンコードしているかどうかが調査され、理論を支持した。
- アブレーションスタディにより、ループ、量子化子、条件分岐などのコンポonentsの必要性が隔離され、検証された。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデルにおける一般の次トークン予測から、文脈内学習(ICL)がどのような条件下で発現するのか。
- RQ2事前学習データにおける構成的構造は、多様なタスクにわたる広範なICL能力をどのように可能にするのか。
- RQ3なぜチェーン・オブ・トゥー(chain-of-thought)プロンプティングがICLパフォーマンスを向上させるのか。
- RQ4モデルパラメータとデータスケールは、ICLの発現にどの程度寄与するのか。
- RQ5構成的構造の表現は、ICLを可能にする上で果たす役割は何か。
主な発見
- 制御された設定において、モデルとデータのスケールに伴いICLが急激に出現し、実世界のLLMと同様の挙動を示したが、訓練は唯一次トークン予測に限定された。
- 中間ステップの生成を促すプロンプトを適用することで、ICLパフォーマンスが著しく向上し、理論的利点(定理2)と整合的であった。
- 理論的境界は、ICLの成功がタスクの構成的記述の複雑さ $\operatorname{D}[\tau_{\phi}]$ に依存することを予測しており、これは実験的に検証された。
- アブレーションスタディにより、変数を導入する構造(例:ループ、「ある種の」)がICLに不可欠である一方、条件分岐はそれほど重要でないことが示された。
- プロービングにより、表現が入力の構成的構造をエンコードしていることが判明し、暗黙の構造誘導の理論を支持した。
- ICLは不自然なプロンプトフォーマットに対しても頑健であったため、メカニズムは表面的形態ではなく、構造的一般化に依存していることが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。