[論文レビュー] Do Models Explain Themselves? Counterfactual Simulatability of Natural Language Explanations
本稿では、大規模言語モデル(LLM)の説明が人間がモデルの挙動を正確に理解するための心的モデルを構築するのを支援するかどうかを評価する新しい評価フレームワーク「反事後シミュラビリティ」を導入する。説明に基づいて反事後入力を生成し、人間の推論精度を実際のLLM出力と照合することで、GPT-4とGPT-3.5の説明は二値タスクにおいて80%の精度にとどまり、精度と妥当性の間には相関が認められず、RLHFに基づく最適化がシミュラビリティを向上させない可能性を示唆している。
Large language models (LLMs) are trained to imitate humans to explain human decisions. However, do LLMs explain themselves? Can they help humans build mental models of how LLMs process different inputs? To answer these questions, we propose to evaluate $ extbf{counterfactual simulatability}$ of natural language explanations: whether an explanation can enable humans to precisely infer the model's outputs on diverse counterfactuals of the explained input. For example, if a model answers "yes" to the input question "Can eagles fly?" with the explanation "all birds can fly", then humans would infer from the explanation that it would also answer "yes" to the counterfactual input "Can penguins fly?". If the explanation is precise, then the model's answer should match humans' expectations. We implemented two metrics based on counterfactual simulatability: precision and generality. We generated diverse counterfactuals automatically using LLMs. We then used these metrics to evaluate state-of-the-art LLMs (e.g., GPT-4) on two tasks: multi-hop factual reasoning and reward modeling. We found that LLM's explanations have low precision and that precision does not correlate with plausibility. Therefore, naively optimizing human approvals (e.g., RLHF) may not be a sufficient solution.
研究の動機と目的
- 大規模言語モデル(LLM)の自然言語説明が、人間が反事後入力におけるモデル挙動を正確に予測できるかどうかを調査すること。
- 説明が人間がLLMの推論や意思決定の正しい心的モデルを形成するのを支援するかどうかを評価する分野におけるギャップを埋めること。
- 説明のシミュラビリティを測るためのメトリクス(シミュレーション精度と一般性)を構築および検証すること。
- 人間による妥当性の最適化(例:RLHFを用いた)が反事後シミュラビリティを向上させるかどうかをテストすること。
- これらの新しいメトリクスを用いて、最先端のLLM(GPT-3.5、GPT-4)を、マルチホップ推論および報酬モデリングタスクでベンチマークすること。
提案手法
- 反事後シミュラビリティを新しい評価パラダイムとして提唱:説明が多様な反事後入力における正しいモデル出力を人間が推論できるかどうか。
- LLMを用いて説明に関連する多様な反事後入力を自動生成(例:『BLT』を『ベーコンバーガー』に変更するなど、食料品の入手可能性に関する質問)。
- 人間のシミュレーションを論理的含意タスクとして定式化することで主観性を低減:人間は説明と反事後入力をもとにモデル出力を推論する。
- 2つのメトリクスを定義:シミュレーション精度(人間の推論がモデル出力と一致する反事後入力の割合)とシミュレーション一般性(関連する反事後入力同士の平均類似度の1マイナス)。
- Chain-of-ThoughtとPost-Hoc説明手法を用いて、GPT-3.5とGPT-4を2つのタスク(StrategyQA:マルチホップ的事実的推論、Stanford Human Preference:報酬モデリング)でベンチマーク。
- シミュレーション精度と人間による妥当性スコアの相関を測定し、承認を得るための最適化がシミュラビリティに与える影響を評価。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデル(LLM)の自然言語説明が、人間が反事後入力におけるモデル挙動を正しく推論できるか?
- RQ2多様な反事後入力において、説明に基づく人間の推論精度は、実際のモデル出力と比べてどの程度か?
- RQ3関連する反事後入力の多様性を測る指標(一般性)としての説明の一般性は、正確な推論を支援する能力と相関するか?
- RQ4人間による説明の妥当性スコアと反事後シミュラビリティ(精度)の間に相関があるか?
- RQ5Chain-of-Thought説明はPost-Hoc説明と比較して、反事後シミュラビリティにおいて優れているか?
主な発見
- GPT-4とGPT-3.5の説明は低精度なシミュレーション精度を示し、二値分類タスクにおいて反事後入力に対するモデル出力の予測精度は80%にとどまる。
- シミュレーション精度と人間による妥当性スコアの間に相関がないため、人間の承認を得るための最適化(例:RLHF)がシミュラビリティを向上させない可能性がある。
- Chain-of-Thought説明はPost-Hoc説明と比較して、反事後シミュラビリティにおいて顕著な優位性を示さない。
- 一般性メトリクスは関連する反事後入力の多様性を捉えており、『ムスリムは豚肉を摂取しない』という説明は『人間は肉を摂取しない』という説明よりも多様な反事後入力を生成する。
- 事例研究では、GPT-4の説明『ムスリムが多く住む国では豚肉は一般的に摂取されない』により、人間は『カサブランカでベーコンバーガーは入手しにくいですか?』という質問に対して『はい』と予測するが、GPT-4自体は『いいえ』と回答しており、不一致が生じている。
- 結果から、事実的に正しいかつ論理的に整合性のある説明でも、人間がLLMの挙動について誤った心的モデルを構築してしまう可能性があることが示唆される。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。