[論文レビュー] Dissecting Recall of Factual Associations in Auto-Regressive Language Models
この論文は、推論中の情報フローを分析することで、自己回帰的言語モデルが事実的関連性をどのように検索するかを解明する。標的付き注意機構の干渉を用いて、3段階のメカニズムを特定した。最初に、初期のMLP層が主題の表現を豊かにする。次に、関係性が予測トークンに伝搬される。最後に、上位のトランスフォーマー層が、主題-属性マッピングをエンコードする注意ヘッドを介して正しい属性を抽出する。このマッピングは、GPT-2では約70%の予測と150のヘッドに見られる。
Transformer-based language models (LMs) are known to capture factual knowledge in their parameters. While previous work looked into where factual associations are stored, only little is known about how they are retrieved internally during inference. We investigate this question through the lens of information flow. Given a subject-relation query, we study how the model aggregates information about the subject and relation to predict the correct attribute. With interventions on attention edges, we first identify two critical points where information propagates to the prediction: one from the relation positions followed by another from the subject positions. Next, by analyzing the information at these points, we unveil a three-step internal mechanism for attribute extraction. First, the representation at the last-subject position goes through an enrichment process, driven by the early MLP sublayers, to encode many subject-related attributes. Second, information from the relation propagates to the prediction. Third, the prediction representation "queries" the enriched subject to extract the attribute. Perhaps surprisingly, this extraction is typically done via attention heads, which often encode subject-attribute mappings in their parameters. Overall, our findings introduce a comprehensive view of how factual associations are stored and extracted internally in LMs, facilitating future research on knowledge localization and editing.
研究の動機と目的
- 自己回帰的言語モデルが推論中に事実的関連性をどのように検索するかという内部メカニズムを理解すること。
- 主題と関係情報が一致して事実的予測を生成するための、トランスフォーマー計算における重要なポイントを特定すること。
- MLPおよびマルチヘッド自己注意(MHSA)サブレイヤーが属性表現を構築および抽出する役割を調査すること。
- 主題-属性マッピングが注意ヘッドのパラメータにエンコードされているかどうか、およびそれが予測にどのように寄与するかを特定すること。
- 今後の知識編集および局在化に関する研究のための、透明で解釈可能な知識想起のビューを提供すること。
提案手法
- 著者たちは、特定の入力位置への最後のトークンからの注意を、さまざまなレイヤーで遮断する標的付き注意ノックアウト干渉を用い、重要度を評価する。
- 主題と関係信号が一致する重要なレイヤーでの表現の変化を測定することで、情報フローを分析する。
- 各レイヤーおよびヘッドにエンコードされた情報を近似するために、隠れ表現を語彙空間に投影する。
- 予測された属性がヘッド出力の上位10トークン内に含まれるかどうかを確認することで、主題-属性マッピングをエンコードするヘッドを同定・分析する。
- GPT-2やGPT-Jのようなデコーダーのみのモデルに焦点を当て、モデルが次トークンを正しく予測する事例を分析する。
- 系統的にコンポONENTを破壊することでその機能的役割を評価するという、遺伝的解析を模倣したリバースエンジニアリングのアプローチを用いる。

実験結果
リサーチクエスチョン
- RQ1主題と関係情報が、どのレイヤーおよび位置で一致して事実的予測を可能にするか?
- RQ2MLPかMHSAサブレイヤーのどちらが、主題表現に属性を豊かにする主な要因か?
- RQ3推論中に、最終的な属性はどのように主題表現から抽出されるか?
- RQ4主題-属性マッピングが、どの程度注意ヘッドのパラメータにエンコードされているか?
- RQ5異なる事実的関連性において、一貫した内部メカニズムが存在するか?
主な発見
- 初期のMLPサブレイヤーが、主題の豊かな属性を含む表現を、主題の最後の位置で構築する。これは主題関連情報の主な供給源である。
- 計算の2つの重要なポイントを同定した。第一に、関係の表現が予測トークンに伝搬される。第二に、豊かにされた主題表現が組み込まれる。
- 最終的な属性抽出は、上位のMHSAサブレイヤーが、関係をキーとして用いて豊かにされた主題表現を照会することで実行される。
- 約70%の事実的予測で、パラメータに直接主題-属性マッピングをエンコードする注意ヘッドが関与しており、GPT-2ではそのようなヘッドが150個同定された。主に上位レイヤーに集中している。
- 属性抽出メカニズムは強固で一貫性がある:関係が注意メカニズムを制御し、主題表現から正しい属性を取得する。
- 本研究の発見は、事実的知識が中層のMLPにのみ保存されているのではなく、パrameterized注意ヘッドを介して能動的に検索されていることを示しており、知識の保存に関する従来の仮定に挑戦する。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。