[論文レビュー] Linearity of Relation Decoding in Transformer Language Models
本稿では、トランスフォーマー言語モデルが関係的知識をどのようにエンコード・デコードするかを調査し、48%のテスト関係(例:'楽器を演奏する' や '色を持つ')について、その知識が主題表現に線形変換(LRE)を適用することでよく近似されることを発見した。この手法は、1つのプロンプトにおけるモデルのヤコビアンから直接線形関係を推定でき、解釈可能な知識編集と『属性レンズ』を用いた可視化を可能にする。この属性レンズにより、誤った出力が生成されても、隠れた事実的知識が明らかにされる。
Much of the knowledge encoded in transformer language models (LMs) may be expressed in terms of relations: relations between words and their synonyms, entities and their attributes, etc. We show that, for a subset of relations, this computation is well-approximated by a single linear transformation on the subject representation. Linear relation representations may be obtained by constructing a first-order approximation to the LM from a single prompt, and they exist for a variety of factual, commonsense, and linguistic relations. However, we also identify many cases in which LM predictions capture relational knowledge accurately, but this knowledge is not linearly encoded in their representations. Our results thus reveal a simple, interpretable, but heterogeneously deployed knowledge representation strategy in transformer LMs.
研究の動機と目的
- トランスフォーマー言語モデルにおける関係的知識が、主題表現への線形変換によってエンコードされているかどうかを調査すること。
- 1つのプロンプトを用いて、さまざまな主題に対して対象トークンを正確に予測できる線形関係埋め込み(LRE)を信頼性高く推定できるかどうかを特定すること。
- LREが、モデルの挙動を編集し、隠れた事実的知識を可視化するのにどの程度利用可能かを評価すること。
- LREの性能をランダムベースラインと比較し、多様な関係タイプにわたる耐性を評価すること。
- 特定の関係的事実を取得するタイミングと場所を明らかにする『属性レンズ』可視化ツールの開発と検証すること。
提案手法
- 著者らは、1つのプロンプトからの主題表現に関するモデル出力のヤコビアンを計算することで、線形関係埋め込み(LRE)を推定し、モデルの一次近似行動を近似する。
- 各関係について、主題表現から対象表現へのマッピングを学習するための線形プローブ(W_r, b_r)を、少数の主題-対象ペアを用いて訓練する。
- LREの妥当性を、予測された対象分布がモデルの実際の次トークン分布とどの程度一致するかを測定することで検証する。
- 各層での隠れ表現を推定されたLREを介して投影する『属性レンズ』可視化を導入し、各層における特定の関係に対する対象トークン分布を示す。
- GPTおよびLLaMAモデルにおける47の関係(事実的、常識的、バイアスのある関係を含む)に対して、単一トークンおよび複数トークンの補完を用いてLREを評価する。
- LREを用いて主題表現を編集し、モデル出力の変化を測定することで、因果的効果を評価する。
実験結果
リサーチクエスチョン
- RQ1トランスフォーマー言語モデルにおける関係的知識は、主題表現の線形変換としてどの程度エンコードされているか?
- RQ21つのプロンプトを用いて、多様な主題にわたる関係の対象予測を捉える線形関係埋め込み(LRE)を信頼性高く推定できるか?
- RQ3LREは、さまざまな関係において、正しい対象トークンを予測する際、ランダムベースラインと比べてどの程度優れているか?
- RQ4LREが失敗する場合、モデルが関係的知識をエンコード・取得するために他の代替メカニズムを用いている可能性は何か?
- RQ5LREを用いて、モデルが誤った出力を生成しても、隠れた事実的知識を可視化・検出できるか?
主な発見
- テストされた47の関係のうち48%について、線形関係埋め込み(LRE)がモデルの関係デコードプロセスを強固かつ忠実に近似している。
- 1つのプロンプトから推定されたLREは、多様な主題に対して正確に対象トークンを予測でき、ランダムベースラインと比べて顕著に優れた性能を示している。
- 属性レンズ可視化は、誤った出力(例:'London')が生成されても、正しいノルウェーの首都といった隠れた事実的知識を効果的に明らかにした。
- LREを用いて主題表現を編集することで、モデル出力を因果的に変更でき、その解釈可能性とモデル制御における有用性を示した。
- 本研究では、知識表現戦略が多様であることが判明した。一部の関係は線形にエンコードされている一方、他の関係はより複雑な非線形メカニズムに依存しており、線形性が普遍的ではないことが示された。
- 本手法により、ランダムベースラインが簡単または難しい関係は、それぞれLRE近似に対してより適応的または不適応的であることが明らかになった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。