[論文レビュー] Generalization v.s. Memorization: Tracing Language Models' Capabilities Back to Pretraining Data
本稿では、意味的類似度と頻度カウントを用いて、大規模言語モデルの能力が事前学習データに戻るスケーラブルなn-gramペア分析を提案する。大きなモデルはタスク関連のn-gramペアを活用することで一般化性能が向上するが、小さなモデルは記憶に依存する。指令微調整は新しい能力を導入せずにデータ利用を向上させる。
The impressive capabilities of large language models (LLMs) have sparked debate over whether these models genuinely generalize to unseen tasks or predominantly rely on memorizing vast amounts of pretraining data. To explore this issue, we introduce an extended concept of memorization, distributional memorization, which measures the correlation between the LLM output probabilities and the pretraining data frequency. To effectively capture task-specific pretraining data frequency, we propose a novel task-gram language model, which is built by counting the co-occurrence of semantically related $n$-gram pairs from task inputs and outputs in the pretraining corpus. Using the Pythia models trained on the Pile dataset, we evaluate four distinct tasks: machine translation, factual question answering, world knowledge understanding, and math reasoning. Our findings reveal varying levels of memorization, with the strongest effect observed in factual question answering. Furthermore, while model performance improves across all tasks as LLM size increases, only factual question answering shows an increase in memorization, whereas machine translation and reasoning tasks exhibit greater generalization, producing more novel outputs. This study demonstrates that memorization plays a larger role in simpler, knowledge-intensive tasks, while generalization is the key for harder, reasoning-based tasks, providing a scalable method for analyzing large pretraining corpora in greater depth.
研究の動機と目的
- 正確な記憶を超えて、事前学習データがLLM能力にどのように寄与するかを理解すること。
- スケールにおける大規模言語モデルの記憶と一般化のバランスを調査すること。
- モデルのパフォーマンスを事前学習コーパス内の特定のn-gramペアに遡ること。
- モデルサイズおよび指令微調整がデータ利用に与える影響を評価すること。
- LLM能力の起源を分析するためのスケーラブルで解釈可能な手法を提供すること。
提案手法
- 事前学習済みエンコーダーを用いた埋め込みベースの類似度(コサイン類似度)により、タスク入力と出力から意味的に類似したn-gramペアを抽出する。
- WIMBDフレームワークを用いて、これらのn-gramペアを全事前学習コーパス(例:The Pile)内で検索し、頻度とソースドキュメントを取得する。
- n-gramペア頻度を用いて事前学習データの分布をモデル化し、タスク関連データに対する弱い監視信号として扱う。
- n-gram頻度を用いて条件付き分布P(y|x)を近似し、それを言語モデルの予測分布と対比するため、対数尤度回帰を実行する。
- 対数データと対数LM確率の間の線形回帰のR²スコアを用いて、事前学習データとLM出力の分布類似度を測定する。
- 生成されたn-gramの勾配類似度と新規性を分析することで、記憶と一般化の程度を評価する。
実験結果
リサーチクエスチョン
- RQ1異なるモデルサイズにおいて、事前学習データ内のタスク関連n-gramペアは、モデルパフォーマンスとどのように関係しているか?
- RQ2大きなモデルはどれほど一般化し、記憶を避け、それが事前学習データ頻度とどのように関連しているか?
- RQ3指令微調整は、微調整データそのものとは独立して、モデルの事前学習データへの依存度にどのように影響するか?
- RQ4十分なタスク関連事前学習データがある場合、記憶から一般化へのシフトが、出現的能力を説明できるか?
- RQ5n-gramペア頻度が、モデルパフォーマンスおよび分布整合性を決定づける役割を果たすか?
主な発見
- 単一のn-gramよりも、タスク関連n-gramペアがタスク関連データをよりよく代表しており、その頻度はモデルパフォーマンスと正の相関を示す。
- モデルサイズが大きくなるにつれて、記憶が減少し、一般化が強化される。分布類似度のR²スコアは、初期には低下し、その後大きなモデルではわずかに上昇する。
- 大きなモデルにおける出現的能力は、十分なタスク関連事前学習データに相関しており、記憶から一般化への移行を示唆する。
- 小さなLLMは記憶に依存するが、大きなLLMは一般化し、事前学習データに存在しないより新しいn-gramを生成する。
- 指令微調整は、微調整データを記憶せずにデータ利用を向上させ、事前学習段階で学習された既存の能力を強化することが示された。
- モデルサイズが大きくなるにつれて、LM出力と事前学習データの分布類似度が低下し、記憶が減少し、一般化が強化されていることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。