[論文レビュー] Cycles of Thought: Measuring LLM Confidence through Stable Explanations
本稿では、生成された説明の安定性を分析することで、大規模言語モデル(LLM)の不確実性を測定する新しいフレームワークを提案する。各説明-回答ペアをテスト時分類器として扱い、説明の含意を用いてこれらの分類器の事後分布を計算することで、5つの多様なベンチマークで選択的不確実性(AUROCおよびAURC)の最先端性能を達成する。特に、複雑な推論タスクにおいて顕著な向上を示す。
In many high-risk machine learning applications it is essential for a model to indicate when it is uncertain about a prediction. While large language models (LLMs) can reach and even surpass human-level accuracy on a variety of benchmarks, their overconfidence in incorrect responses is still a well-documented failure mode. Traditional methods for ML uncertainty quantification can be difficult to directly adapt to LLMs due to the computational cost of implementation and closed-source nature of many models. A variety of black-box methods have recently been proposed, but these often rely on heuristics such as self-verbalized confidence. We instead propose a framework for measuring an LLM's uncertainty with respect to the distribution of generated explanations for an answer. While utilizing explanations is not a new idea in and of itself, by interpreting each possible model+explanation pair as a test-time classifier we can calculate a posterior answer distribution over the most likely of these classifiers. We demonstrate how a specific instance of this framework using explanation entailment as our classifier likelihood improves confidence score metrics (in particular AURC and AUROC) over baselines across five different datasets. We believe these results indicate that our framework is both a well-principled and effective way of quantifying uncertainty in LLMs.
研究の動機と目的
- 高リスクな応用分野におけるLLMの過信予測という重要な問題に対処すること。
- モデルの重みや内部状態へのアクセスを必要としないブラックボックス型の不確実性評価手法を開発すること。
- 従来のヒューリスティック手法を上回る、正しくない予測を正しくない予測と区別する選択的不確実性性能の向上。
- 説明に基づく分類器に対する伝達的マージナル化を通じて、不確実性推定を形式化すること。
- 多様で複雑なベンチマークを用いて、本手法の頑健性と一般化性能を評価すること。
提案手法
- 本手法は、各LLM生成説明-回答ペアをテスト時分類器として扱い、可能な分類器の分布を形成する。
- 説明の含意を分類器の尤度の代理として用いることで、これらの分類器の周辺化を経て事後予測分布を計算する。
- 説明の含意を用いて、回答との論理的整合性に基づき説明をフィルタリングおよび再重み付けすることで、信頼度のキャリブレーションを向上させる。
- 本フレームワークはテスト時にチェーン・オブ・トゥークの推論を利用するが、内容そのものよりも説明の安定性に焦点を当てる。
- 最終的な信頼度スコアは、安定的かつ含意検証済みの説明-回答ペアの分布から導出される。
- 本手法はGPT-3.5およびGPT-4を用いて実装され、標準的な不確実性指標を用いて5つの多様なデータセットで評価される。

実験結果
リサーチクエスチョン
- RQ1モデルの内部構造が不明な状況下でも、説明の安定性がLLMの信頼度の信頼できる代理として機能するか。
- RQ2説明に基づく分類器の重み付けに含意を用いることで、ベースラインと比較して選択的不確実性性能が向上するか。
- RQ3本手法は、複雑さの異なるデータセット、特に推論を要するタスクにおいて、どのように性能を示すか。
- RQ4ヒューリスティックな自己説明による自己検証に依存せずに、誤った回答における過信をどの程度軽減できるか。
- RQ5テスト時の説明分布を用いて、LLMにおけるベイジアン事後予測分布を近似できるか。
主な発見
- 提案手法の安定的説明信頼度評価は、5つのデータセットの平均で、すべてのベースラインを上回り、最高のAUROCおよびAURCスコアを達成した。
- MMLUプロフェッショナル・ロウデータセットでは、GPT-3.5-Turboを用いてAUROC 0.784、AURC 0.131を達成し、次に良い手法を顕著に上回った。
- GPT-4-Turboを用いた場合、CommonsenseQAでAUROC 0.899、AURC 0.131を達成し、複雑な推論タスクにおいて強力な性能を示した。
- アブレーションスタディの結果、含意による再重み付けと説明条件付き回答分布の組み合わせが、個々の要素よりも優れた性能を示した。
- 本手法は、特にマルチステップ推論を要する複雑な質問(例:MMLU法曹および物理学)において顕著な向上を示したが、ベースライン手法はしばしば失敗する。
- 選択的不確実性において顕著な向上を示したが、ECE(期待エントロピー)性能は最先端ではなかった。著者らは、分布シフト下でのECEの根本的限界に起因すると説明している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。