[論文レビュー] Explaining black box text modules in natural language with language models
本稿では、テキストからスカラー値への写像を定義するブラックボックステキストモジュール(関数)の自然言語による説明を自動生成する手法SASCを提案する。2段階のプロセスに基づく:(1)事前学習済み言語モデルを用いて、高活性化ngramを要約し、候補となる説明を生成する。そして(2)合成テキストを生成し、そのモジュール反応をテストすることで、説明のスコアを付与する。SASCは合成環境下で真の説明を的確に回復でき、BERTニューロンの意味的説明を可能にし、fMRIボクセルに対しても意味的に根拠のある説明を生成し、脳領域における明確な選択性パターンを明らかにした。
Large language models (LLMs) have demonstrated remarkable prediction performance for a growing array of tasks. However, their rapid proliferation and increasing opaqueness have created a growing need for interpretability. Here, we ask whether we can automatically obtain natural language explanations for black box text modules. A "text module" is any function that maps text to a scalar continuous value, such as a submodule within an LLM or a fitted model of a brain region. "Black box" indicates that we only have access to the module's inputs/outputs. We introduce Summarize and Score (SASC), a method that takes in a text module and returns a natural language explanation of the module's selectivity along with a score for how reliable the explanation is. We study SASC in 3 contexts. First, we evaluate SASC on synthetic modules and find that it often recovers ground truth explanations. Second, we use SASC to explain modules found within a pre-trained BERT model, enabling inspection of the model's internals. Finally, we show that SASC can generate explanations for the response of individual fMRI voxels to language stimuli, with potential applications to fine-grained brain mapping. All code for using SASC and reproducing results is made available on Github.
研究の動機と目的
- 大規模言語モデル(LLM)やその他のブラックボックステキストモジュールにおける解釈不能性の問題に対処すること。内部メカニズムが不透明な状態が続くことが課題である。
- モデル内部構造や人為的アノテーションを一切必要としない、自動的かつブラックボックス方式の、人間が読める自然言語によるテキストモジュールの説明を生成すること。
- 多様な分野にわたる評価を実施すること:合成モジュール、BERTモデル内部、およびfMRIに基づく脳符号化モデル。
- 説明が実際にモジュールの挙動に基づいており、特に神経科学的応用において意味的・意味的根拠を持つことの確認。
- 医療や認知科学など、高リスク分野における解釈可能性を実現するスケーラブルでオープンソースのツールを提供すること。
提案手法
- SASCは2段階のパイプラインを用いる:まず、コーパスから上位活性化ngramを特定し、事前学習済み言語モデルを用いてそれらを要約して候補説明を生成する。
- 次に、各候補説明について、説明に基づいて合成テキストを生成し、そのターゲットモジュールへの反応を測定することでスコアを付与する。
- 説明生成と評価を分離することで幻覚を低減する目的で、要約とテキスト生成に補助的なLLMを用いる。
- BERTからの解釈可能な成分を抽出するために辞書学習を適用し、その後SASCを用いて個々のニューロンやサブモジュールを説明する。
- fMRIの文脈では、各ボクセルの応答をテキストモジュールとみなす。ngramコーパスとして物語的テキストやWikiTextを用いる。
- 説明の信頼性は応答の一貫性に基づいてスコア化される。高いスコアは、説明がモジュールの強力な活性化を一貫して予測できることを示す。

実験結果
リサーチクエスチョン
- RQ1SASCは、内部モデルパラメータにアクセスできない状態でも、ブラックボックステキストモジュールに対して正確で自然言語による説明を自動生成できるか?
- RQ2既知のパターンを持つ合成モジュールにおいて、SASCは真の説明をどれほど正確に回復できるか?
- RQ3SASCが生成するBERTニューロンの説明は、人為的アノテーションの説明と同等の品質を持ち、下流タスクの意味論と整合性を示すか?
- RQ4fMRIボクセルの説明は意味的に意味のある選択性を反映しており、BERTモジュールの説明とは異なるか?
- RQ5SASCが生成する説明は、ngramの重複が少ない状況でも、実際のfMRI応答を予測できるか?
主な発見
- 合成モジュールでは、複数の実験条件において、SASCは真の説明を高い正確性で回復した。これは優れた忠実性を示している。
- BERTモジュールでは、SASCの説明は人為的アノテーションの説明と同等の品質であり、多くの場合、センチメントや固有表現といったタスク関連の意味論を捉えていた。
- BERTモジュールは、個々の語から抽象的意味概念に至るまで、多様な現象に対して選択性を示しており、既知の言語的役割と整合的であった。
- fMRIボクセルの説明は、BERTモジュールの説明と比較して、社会的要因(例:人間関係、家族)にはるかに焦点を当てており、脳内での機能的組織の違いを示唆した。
- fMRIボクセルにおいても、説明スコアは有意にゼロより上に保たれ、説明の信頼性が確認された。
- 説明テキストに基づく単純な距離ベースの予測が、実際のfMRI応答とスピアマン相関係数0.033 ± 0.002を示し、これは有意にゼロより大きい(p < 0.001)ことから、実際の脳活動と根拠を持つことが示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。