[論文レビュー] Physics of Language Models: Part 3.1, Knowledge Storage and Extraction
この論文は、大規模言語モデルが事実知識をどのように記憶・抽出するかを調査し、事実抽出が事前学習中のデータ拡張に大きく依存することを示している。制御された合成バイオグラフィデータセットを用いて、訓練データに十分な言い換えや構造的多様性がなければ、モデルは事実を記憶するが、それらについての質問に答えることができない(微調整後でさえも)ことが示された。これは、隠れ状態における非線形的かつ抽出不能な符号化に起因する。
Large language models (LLMs) can store a vast amount of world knowledge, often extractable via question-answering (e.g., "What is Abraham Lincoln's birthday?"). However, do they answer such questions based on exposure to similar questions during training (i.e., cheating), or by genuinely learning to extract knowledge from sources like Wikipedia? In this paper, we investigate this issue using a controlled biography dataset. We find a strong correlation between the model's ability to extract knowledge and various diversity measures of the training data. $ extbf{Essentially}$, for knowledge to be reliably extracted, it must be sufficiently augmented (e.g., through paraphrasing, sentence shuffling, translations) $ extit{during pretraining}$. Without such augmentation, knowledge may be memorized but not extractable, leading to 0% accuracy, regardless of subsequent instruction fine-tuning. To understand why this occurs, we employ (nearly) linear probing to demonstrate a strong connection between the observed correlation and how the model internally encodes knowledge -- whether it is linearly encoded in the hidden embeddings of entity names or distributed across other token embeddings in the training text. This paper provides $ extbf{several key recommendations for LLM pretraining in the industry}$: (1) rewrite the pretraining data -- using small, auxiliary models -- to provide knowledge augmentation, and (2) incorporate more instruction-finetuning data into the pretraining stage before it becomes too late.
研究の動機と目的
- 言語モデルが事実の質問に答える際、訓練データから知識を抽出しているのか、それとも訓練中に類似する質問を記憶しているのかを特定すること。
- 事前学習中にデータ拡張(例:言い換え、文のシャッフル)が、事前学習データからの信頼性の高い知識抽出をどのように促進するかを調査すること。
- モデルの重みに知識がどのように符号化されているか、そしてそれがプローブ技術によって線形にアクセス可能かどうかを理解すること。
- 事前学習中にインstructファインチューニングデータを組み込むことが、下流の質問応答性能に与える影響を評価すること。
- 構造的プロービング手法を用いて、高リソースグループから低リソースグループへの知識の転送可能性を検討すること。
提案手法
- 出生日、都市などの制御された属性を持つ10万件のバイオグラフィから成る合成データセットを構築し、LLaMAを用いて自然な言語スタイルに再ライティングした。
- 全データセットで言語モデルを事前学習し、その後、一部の個人(p 分数)の質問-回答ペアで微調整した。
- 分布外の個人(1-p 分数)に対するゼロショット一般化を評価し、記憶と知識抽出を分離した。
- PプロービングとQプロービングを適用し、エンティティ属性に関する知識がモデルの隠れ表現に線形に符号化されているかどうかを分析した。
- さまざまなランク設定を用いたLoRAベースの微調整を実施し、パラメータ効率の良い適応がQA性能に与える影響を評価した。
- 全名の使用、文の順序の入れ替え、フォーマットの多様性などを含む、さまざまなデータ拡張戦略の性能を比較した。
実験結果
リサーチクエスチョン
- RQ1言語モデルは、事実の質問に答える際、訓練データから知識を抽出しているのか、それとも訓練中に類似する質問を記憶しているのか?
- RQ2事前学習中にデータ拡張(例:言い換え、シャッフル)が行われると、推論時の事実知識抽出能力にどのように影響するか?
- RQ3エンティティに関する知識が、モデルの隠れ状態にどの程度線形に符号化されており、それが抽出可能性にどのように影響するか?
- RQ4多様性のあるフォーマットと構造を含む有名人データを事前学習に組み込むことで、低リソースグループ(例:マイノリティ)に対する知識抽出が向上するか?
- RQ5事前学習中にインstructファインチューニングデータを組み込むと、下流のQA精度にどのような影響を与えるか?
主な発見
- 事前学習中にデータ拡張が行われない場合、微調整済みのモデルでも、未確認の個人に対してQA精度が0%にとどまる。
- データの多様性(例:言い換え、文のシャッフル)とモデルの知識抽出能力の間に強い相関関係が確認され、拡張が抽出可能な知識記憶を可能にしていることが示された。
- 有名人データに多様なフォーマットと構造を含めることで、マイノリティグループに関する知識の抽出がより信頼性が高まり、QA精度が顕著に向上した。
- Pプロービングの結果、有名人データが使用された場合、マイノリティグループに関する知識はしばしば初期トークンに符号化されており、属性がより直接的かつ線形的に符号化されていることが示された。
- Qプロービングは、拡張済みデータで訓練されたモデルが、特に全名と多様な文構造が使用された場合、より高い全属性予測精度を達成していることを確認した。
- 高ランクのアダプタを用いたLoRAベースの微調整はQA性能を向上させるが、これは事前学習データに十分な構造的多様性が存在し、線形プローブ可能である場合に限る。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。