[論文レビュー] A Latent Space Theory for Emergent Abilities in Large Language Models
本稿では、大規模言語モデル(LLMs)における顕在的能力を、言語のスパースな連合分布上のベイズ推論として説明する潜在空間理論を提案する。明確な言語、またはε-曖昧な言語では、正確な推論が可能である。主な貢献は、LLMsの能力——インライン学習やチェーン・オブ・トゥーク・プロンプティング——が、周辺分布の普遍的近似器としてのモデルの動作によって生じることを示したことである。モデルとデータのスケーリングに伴い、最適な推論に収束する。
Languages are not created randomly but rather to communicate information. There is a strong association between languages and their underlying meanings, resulting in a sparse joint distribution that is heavily peaked according to their correlations. Moreover, these peak values happen to match with the marginal distribution of languages due to the sparsity. With the advent of LLMs trained on big data and large models, we can now precisely assess the marginal distribution of languages, providing a convenient means of exploring the sparse structures in the joint distribution for effective inferences. In this paper, we categorize languages as either unambiguous or ε-ambiguous and present quantitative results to demonstrate that the emergent abilities of LLMs, such as language understanding, in-context learning, chain-of-thought prompting, and effective instruction fine-tuning, can all be attributed to Bayesian inference on the sparse joint distribution of languages.
研究の動機と目的
- 大規模言語モデル(LLMs)における顕在的能力が、自己教師付き事前学習を行ってもスケールに達しないと現れない理由を説明すること。
- 特に意図とメッセージの連合分布におけるスパarsityが推論を可能にする言語構造の役割を形式化すること。
- LLMの能力と潜在的意図空間上のベイズ推論を結びつける理論的基盤を確立すること。
- さまざまな曖昧度レベルを持つ合成言語を用いたシミュレーションを通じて理論を検証すること。
- モデルとデータがスケーリングする中で、インライン学習と言語理解が出現する条件を明確にすること。
提案手法
- メッセージが与えられたときの意図の条件付き確率に基づき、言語を明確(Pr(θ|x) = 1)またはε-曖昧(Pr(θ|x) ≥ 1−ε)に分類する。
- まず事前分布 q(θ) から意図 θ をサンプリングし、次に q(x|θ) からメッセージ x を生成する2段階の確率的プロセスとして言語生成をモデル化する。
- LLMsを周辺分布 p(x) の普遍的密度近似器として位置づけ、潜在的意図 θ に対する推論を可能にする。
- 検証データセット上で、モデルの条件付き分布 p(y|x) と真の条件付き分布 q(y|x,θ) の乖離をKLダイバージェンスで測定する。
- 漸近的解析を適用し、モデル容量と学習データが増加するにつれて p(x) が真の周辺分布に収束し、正確なベイズ推論が可能になることを示す。
- 制御された曖昧度レベルを持つ合成言語をシミュレートし、LLMsの言語理解およびインライン学習タスクにおける性能を評価する。

実験結果
リサーチクエスチョン
- RQ1LLMsにおける顕在的能力が、次トークン予測で学習されているにもかかわらず、なぜスケールに達しないと現れないのか?
- RQ2意図とメッセージの連合分布のスパarsityが、LLMsがインライン学習や推論を実行できるようにする仕組みは何か?
- RQ3メッセージ-意図マッピングにおける曖昧さ(ε)が、LLM能力の顕在に果たす役割は何か?
- RQ4言語理解とインライン学習を、潜在的意図空間上のベイズ推論として形式的に説明できるか?
- RQ5モデルサイズと学習データを増加させることで、分布近似がどのように収束し、顕在的能力が可能になるか?
主な発見
- LLMsは、言語が明確(Pr(θ|x) = 1)である場合に、モデルと真の条件付き分布のKLダイバージェンスが最小限に抑えられ、正確な言語理解を達成する。
- ε-曖昧な言語では、KLダイバージェンスがわずかに増加するが、プロンプトに追加のインライン例を加えることでこれを軽減できる。
- 明確な言語では、インライン学習のパフォーマンスはKLダイバージェンスが安定かつ低く保たれるが、曖昧な言語では、より多くの例を提供しない限り劣化する。
- 学習データとモデルサイズが増加するにつれて、LLMが推定する周辺分布 p(x) は真の分布 q(x) に収束し、効果的なベイズ推論が可能になる。
- 理論的解析により、モデルとデータが十分にスケーリングされた段階で、顕在的能力が漸近的に出現することが示され、観察されたスケーリング則と整合的である。
- シミュレーション結果は、ε値が低い合成言語でLLMsのパフォーマンスがより良いことを確認しており、曖昧さと推論精度に関する理論の予測を裏付けている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。