[論文レビュー] How Large Language Models Encode Context Knowledge? A Layer-Wise Probing Study
本稿では、大規模言語モデル(LLMs)が文脈知識をどのようにエンコードするかを調査するためのレイヤー単位のプロービングフレームワークを提案する。ChatGPTが生成した証拠と$Σ$-利用可能情報($Σ$-usable information)を指標として用いる。その結果、LLMsは上位レイヤーに文脈知識をより多くエンコードしており、深さに応じてエンティティトークンから広い文脈へと知識が転送され、不要な証拠にさらされると干渉を受けることが明らかになった。これにより、内部の知識保持における重要なダイナミクスが解明された。
Previous work has showcased the intriguing capability of large language models (LLMs) in retrieving facts and processing context knowledge. However, only limited research exists on the layer-wise capability of LLMs to encode knowledge, which challenges our understanding of their internal mechanisms. In this paper, we devote the first attempt to investigate the layer-wise capability of LLMs through probing tasks. We leverage the powerful generative capability of ChatGPT to construct probing datasets, providing diverse and coherent evidence corresponding to various facts. We employ $\mathcal V$-usable information as the validation metric to better reflect the capability in encoding context knowledge across different layers. Our experiments on conflicting and newly acquired knowledge show that LLMs: (1) prefer to encode more context knowledge in the upper layers; (2) primarily encode context knowledge within knowledge-related entity tokens at lower layers while progressively expanding more knowledge within other tokens at upper layers; and (3) gradually forget the earlier context knowledge retained within the intermediate layers when provided with irrelevant evidence. Code is publicly available at https://github.com/Jometeorie/probing_llama.
研究の動機と目的
- 大規模言語モデルの隠れ層を横断して、文脈知識がどのようにエンコードされるかを調査し、その内部メカニズムの理解に欠けている点を埋める。
- ChatGPTが生成する多様で整合性のある証拠を用いて、信頼性の高いプロービングフレームワークを構築し、レイヤー単位での知識エンコードを評価する。
- 異なるLLMのレイヤーが、矛盾する知識や新たに習得した知識をどの程度エンコードできるかを、$Σ$-利用可能情報を判別指標として用いて測定・比較する。
- 増加する不要な証拠の下で文脈知識の長期記憶容量をテストすることで、LLMsの記憶保持能力を検証する。
- 自己注意機構と位置符号化が、レイヤー間での知識表現に果たす役割を解明する。
提案手法
- ChatGPTを用いて、事実および反事実に関する多様で整合性のある証拠を生成し、プロービングデータセットを構築する。
- 生成された証拠と質問をLLaMA 2モデルに供給し、各隠れ層の表現を抽出してプロービングに用いる。
- $Σ$-利用可能情報を主指標として用い、レイヤー表現における文脈知識の識別可能性を評価する。
- 矛盾する知識(例:パrametricな事実の是正)や新たに習得した知識(例:パスワード)を評価するためのプロービングタスクを設計する。
- 証拠の関連性と位置符号化を系統的に変化させ、中間レイヤーにおける耐性と干渉効果をテストする。
- ヒートマップを用いてレイヤー単位のプロービング結果を可視化し、レイヤーおよびトークン種別における知識エンコードのパターンを特定する。
実験結果
リサーチクエスチョン
- RQ1LLMsは、その隠れ層全体にわたり、文脈知識エンコードをどのように分布させるか?
- RQ2文脈知識は、主にエンティティトークンに、それとも広い文脈全体にエンコードされるのか?
- RQ3不要な証拠が存在する場合、中間レイヤーにおける新たに習得した知識の保持にどのような影響を与えるか?
- RQ4自己注意機構は、レイヤーが深くなるに従い、エンティティトークンから他のトークンへと知識をどの程度効果的に転送するか?
- RQ5位置符号化は、レイヤー表現における文脈知識の検出可能性に顕著な影響を及ぼすか?
主な発見
- LLMsは文脈知識を上位レイヤーにエンコードする傾向が強く、矛盾する知識のシナリオでは、深さが増すほど$Σ$-利用可能情報が最大値を示す。
- 知識関連のエンティティトークンは下位レイヤーでより多くの文脈知識をエンコードするが、上位レイヤーではその優位性が薄れ、他のトークンに取り込まれる。
- 自己注意機構が、レイヤーが深くなるに従い、エンティティトークンから周囲の文脈トークンへと知識を段階的に転送する。
- 不要な証拠にさらされた場合、中間レイヤーでは顕著な性能低下が見られ、新たに習得した知識の保持が妨げられることから、干渉が生じていることが示された。
- 位置符号化(例:改行トークンの追加)はプロービング結果にほとんど影響を及ぼさず、知識エンコード検出において無視できるノイズであると示唆された。
- パスワードのような新たに習得した事実に対しても、モデルの文脈知識エンコード能力は依然として頑健であるが、不要な文脈が増えるにつれて性能が低下する傾向が見られた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。