[論文レビュー] FIND: A Function Description Benchmark for Evaluating Interpretability Methods
本稿では、ブラックボックス関数の自然言語またはコードによる記述を生成する自動解釈手法の評価を目的としたFINDというベンチマークを紹介する。ノイズやバイアスといった現実世界の複雑性を有する手続き的に生成された関数を用いて、大規模言語モデル(LLMs)および仮説駆動の実験を用いる新規な自動解釈エージェント(AIA)の評価を行う。結果として、LLMsは関数の全体的挙動を捉えられるが、局所的詳細を逃す傾向にあり、自動解釈分野における高度なツール開発の必要性が浮き彫りになる。
Labeling neural network submodules with human-legible descriptions is useful for many downstream tasks: such descriptions can surface failures, guide interventions, and perhaps even explain important model behaviors. To date, most mechanistic descriptions of trained networks have involved small models, narrowly delimited phenomena, and large amounts of human labor. Labeling all human-interpretable sub-computations in models of increasing size and complexity will almost certainly require tools that can generate and validate descriptions automatically. Recently, techniques that use learned models in-the-loop for labeling have begun to gain traction, but methods for evaluating their efficacy are limited and ad-hoc. How should we validate and compare open-ended labeling tools? This paper introduces FIND (Function INterpretation and Description), a benchmark suite for evaluating the building blocks of automated interpretability methods. FIND contains functions that resemble components of trained neural networks, and accompanying descriptions of the kind we seek to generate. The functions span textual and numeric domains, and involve a range of real-world complexities. We evaluate methods that use pretrained language models (LMs) to produce descriptions of function behavior in natural language and code. Additionally, we introduce a new interactive method in which an Automated Interpretability Agent (AIA) generates function descriptions. We find that an AIA, built from an LM with black-box access to functions, can infer function structure, acting as a scientist by forming hypotheses, proposing experiments, and updating descriptions in light of new data. However, AIA descriptions tend to capture global function behavior and miss local details. These results suggest that FIND will be useful for evaluating more sophisticated interpretability methods before they are applied to real-world models.
研究の動機と目的
- 自動解釈手法が関数の記述を生成する際の標準化された評価の欠如に応えること。
- ブラックボックス関数の挙動をいかに正確に推論し記述できるかを評価するベンチマークを構築すること。
- 大規模言語モデル(LLMs)および新規なインタラクティブエージェント(AIA)が、関数の正確で人間が読める記述を生成する効果性を評価すること。
- 現在のLLMベースのアプローチが、全体的理解は持てるものの局所的挙動やエッジケースを捉えられないという限界を特定すること。
- 現実的で複雑な関数における性能を特徴づけることで、将来の自動解釈ツール開発を支援すること。
提案手法
- FINDは、数値的、テキスト的、および合成ニューラルモジュールの3つの分野にまたがる2,000件以上の関数解釈問題を含む手続き的生成ベンチマークである。
- 関数は、現実のモデル解釈における課題を模倣するため、合成、近似、バイアス、ノイズといった現実世界の複雑性を備えている。
- ベースライン評価では、LLMsを用いて関数挙動の自然言語的およびコードベースの記述を生成し、正解実装と比較する。
- 自動解釈エージェント(AIA)を導入し、LLMを用いて仮説を立て、入力を選択し、出力を観測し、記述を改善するという反復的プロセスを経て、科学的思考法を模倣する。
- 評価には、文字列関数に対しては文字列一致、コードに対しては構造的類似度を用い、関数サブカテゴリごとに成績スコアを算出する。
- AIA手法により、静的キャプションベースラインとは異なり、動的かつインタラクティブにデータ生成と仮説の更新が可能になる。
実験結果
リサーチクエスチョン
- RQ1LLMベースの手法は、ノイズやバイアスといった現実世界の複雑性を有する複雑なブラックボックス関数の挙動を正確に記述できるか?
- RQ2仮説検証とデータ駆動による改善を用いるインタラクティブな自動解釈エージェント(AIA)は、関数構造を推定する上でどの程度効果的か?
- RQ3LLMsは関数の全体的挙動をどの程度捉えられるか、一方で局所的またはエッジケースの挙動をどの程度見逃すか?
- RQ4GPT-3.5とGPT-4といった異なるLLMsは、多様な関数タイプの解釈において、どの程度の能力を示すか?
- RQ5市販のLLMsは、極めて特定の参照エンティティ(例:『ニューヨーク・タイムズ』)を含む関数を解釈する際にどのような限界を示し、それらはどのように克服できるか?
主な発見
- GPT-4とGPT-3.5はエンティティベースの関数の解釈において同等の性能を示し、モデルサイズに依存しないことが示された。
- LLMベースの記述は関数の全体的挙動を捉えるが、地域特有の例外など局所的欠陥やエッジケースを捉えられないことが多かった。
- 反復的仮説検証とデータ生成を用いるAIA手法は、静的キャプションベースラインを上回り、関数挙動のより深い探査を可能にした。
- 文字列関数は複雑またはバイアスを有する関数よりも信頼性が高く、サブカテゴリごとに成績スコアの差が顕著に現れた。
- ベンチマークから、市販のLLMsは極めて特定の参照エンティティ(例:『ニューヨーク・タイムズ』)を扱う際に困難を示すことが判明し、より良い例示初期化戦略の必要性が示された。
- 複雑な関数はアトミック関数よりも解釈が難しく、合成度やバイアスの増加に伴い成績率が著しく低下した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。