[論文レビュー] Linear Representations of Sentiment in Large Language Models
この論文は、大規模言語モデルにおけるセンチメントが、活性化空間における単一の方向に線形的に表現されていることを明らかにした。この方向はセンチメント予測において因果的に有意である。因果的干渉と回路解析を通じて、センチメントがコロンやピリオドのような中立的トークンに集約される「要約モチーフ」を同定した。このモチーフを無効化すると、ゼロショットSST精度の36%が失われる。
Sentiment is a pervasive feature in natural language text, yet it is an open question how sentiment is represented within Large Language Models (LLMs). In this study, we reveal that across a range of models, sentiment is represented linearly: a single direction in activation space mostly captures the feature across a range of tasks with one extreme for positive and the other for negative. Through causal interventions, we isolate this direction and show it is causally relevant in both toy tasks and real world datasets such as Stanford Sentiment Treebank. Through this case study we model a thorough investigation of what a single direction means on a broad data distribution. We further uncover the mechanisms that involve this direction, highlighting the roles of a small subset of attention heads and neurons. Finally, we discover a phenomenon which we term the summarization motif: sentiment is not solely represented on emotionally charged words, but is additionally summarized at intermediate positions without inherent sentiment, such as punctuation and names. We show that in Stanford Sentiment Treebank zero-shot classification, 76% of above-chance classification accuracy is lost when ablating the sentiment direction, nearly half of which (36%) is due to ablating the summarized sentiment direction exclusively at comma positions.
研究の動機と目的
- 大規模言語モデル(LLMs)の内部でセンチメントがどのように表現されているかを調査すること、特にそれが線形にエンコードされているかどうかを特定すること。
- 活性化空間における単一の方向が、合成的および現実世界のタスクの両方においてセンチメント予測に因果的に影響を与えているかどうかを検証すること。
- センチメント表現と要約に責任を持つ神経回路(特定の注意ヘッドとニューロン)を同定すること。
- 中間的で感情的でないトークン(例:コロン、名前など)が、層をまたいでセンチメント情報を要約する役割を果たしているかどうかを調査すること。
- SSTやOpenWebTextを含む多様なモデルとデータセットにおいて、センチメント表現の頑健性と一般化可能性を評価すること。
提案手法
- センチメント方向の因果的寄与を隔離・テストするため、因果的メディエーション分析フレームワークを用いる。
- 活性化パッチ処理と方向的無効化を適用し、センチメント方向がモデル予測に与える因果的寄与を測定する。
- おもちゃデータセット(ToyMovieReview)の活性化埋め込みに対してK-meansクラスタリングを用いてセンチメント方向を学習し、実世界のデータ(SST)で検証する。
- transformer-lensライブラリを用いて詳細な回路解析を実施し、センチメント表現に関与する主要な注意ヘッドとニューロンを同定する。
- 方向的パッチ処理を実装し、特定のトークンでセンチメント情報を注入または除去することで、最終予測への影響をテストする。
- 複数のモデル(GPT-2, Pythia)と層を比較し、センチメント方向の一貫性と一般化可能性を評価する。
実験結果
リサーチクエスチョン
- RQ1多様なモデルとタスクにおいて、LLMsの活性化空間にセンチメントが単一の線形方向として表現されているか?
- RQ2干渉技術を用いて、このセンチメント方向が最終的なセンチメント予測に因果的に関連しているか?
- RQ3中間的で感情的でないトークン(例:コロン、ピリオド、固有名)が、センチメント情報の要約ハブとして機能しているか?
- RQ4どの特定の注意ヘッドとニューロンがセンチメント表現のエンコードと伝搬に最も関与しているか?
- RQ5特に要約トークンで無効化した場合に、モデルのセンチメント分類性能の何パーセントがセンチメント方向に起因しているか?
主な発見
- 活性化空間における単一の線形方向が、英語およびフランス語のテキストを含む多様な文脈においてセンチメントを捉えており、センチメントラベルと高い相関を示す。
- センチメント方向の因果的無効化により、ゼロショットSST精度がランダム予測より76%低下し、その因果的有意性が裏付けられる。
- 特にコロンの位置でセンチメント方向を無効化すると、全体の精度損失の36%を占め、これが「要約モチーフ」を示している。
- GPT-2やPythiaといった複数のモデルと層において、センチメント方向は頑健であり、一般化可能な内部表現であることが示された。
- センチメントをエンコード・伝搬する主な責任を担うのは、少数の注意ヘッドとニューロンに限られており、コンactかつ解釈可能な回路であることが示唆される。
- センチメント方向は単なる価値語の代理ではなく、句読点や名前のような中立的トークンを通じて情報が集中する高次の抽象化を捉えている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。