[論文レビュー] Just Ask for Calibration: Strategies for Eliciting Calibrated Confidence Scores from Language Models Fine-Tuned with Human Feedback
この論文は、強化学習による人間のフィードバック(RLHF)でファインチューニングされた言語モデルに対して、自信スコアを言語的に表現するプロンプトを提示することで、元の対数尤度とは対照的に著しく良好にキャリブレーションされた予測が得られることを提案している。GPT-3.5-turbo、GPT-4、Claude 2 などのモデルでは、言語的自信表現により期待キャリブレーション誤差(ECE)が50%以上低減され、特にマルチハイポセシスプロンプティングと組み合わせると、実世界の展開において信頼性を向上させる実用的でゼロショットの手法が得られる。
A trustworthy real-world prediction system should produce well-calibrated confidence scores; that is, its confidence in an answer should be indicative of the likelihood that the answer is correct, enabling deferral to an expert in cases of low-confidence predictions. Recent studies have shown that unsupervised pre-training produces large language models (LMs) whose conditional probabilities are remarkably well-calibrated. However, the most widely-used LMs are fine-tuned with reinforcement learning from human feedback (RLHF-LMs), and some studies have suggested that RLHF-LMs produce conditional probabilities that are very poorly calibrated. In light of this perceived weakness, we conduct a broad evaluation of methods for extracting confidence scores from RLHF-LMs. For RLHF-LMs such as ChatGPT, GPT-4, and Claude, we find that verbalized confidences emitted as output tokens are typically better-calibrated than the model's conditional probabilities on the TriviaQA, SciQ, and TruthfulQA benchmarks, often reducing the expected calibration error by a relative 50%.
研究の動機と目的
- 強化学習による人間のフィードバック(RLHF)でファインチューニングされた言語モデルにおける自信スコアの不良キャリブレーションを是正すること。これらのモデルはしばしば予測の確実性を過大評価する。
- 数値または言語的表現(例:「非常に確実」)としての自信スコアの言語的表現が、モデルが推定する対数尤度と比較して、より良好にキャリブレーションされた出力を得られるかどうかを評価すること。
- 複数の仮説を生成するプロンプティング戦略(例:複数の回答候補を生成してから自信スコアを割り当てる)が、言語的自信表現のキャリブレーションを向上させるかどうかを調査すること。
- 追加のファインチューニングなしに、ゼロショットプロンプティングによってモデルの尤度値よりも良好なキャリブレーションを達成できるかどうかを検証すること。
- GPT-3.5-turbo、GPT-4、Claude 2、Llama-2-70b-chat などの多様なモデルと、TriviaQA、SciQ、TruthfulQA などのベンチマークにおいて、これらの発見が一般化するかどうかを評価すること。
提案手法
- RLHFでファインチューニングされた言語モデルに、自然言語としての自信スコア(例:「非常に確実」や「70%の確信」)を直接トークン空間で出力させるプロンプトを提示する。
- 心理的技術にインspiredされたゼロショットプロンプティング戦略を採用し、自信スコアを割り当てる前に複数の回答仮説を生成させる。この戦略により、過剰な自信(overconfidence)を軽減する。
- 期待キャリブレーション誤差(ECE)、ブライアスコア(BS)、受信器操作特性曲線下の面積(AUC)といった標準的なキャリブレーション指標を用いて、言語的自信スコアのキャリブレーションを評価する。
- 特に GPT-3.5-turbo や GPT-4 に対して、温度スケーリングを適用して言語的確率のキャリブレーションをさらに向上させる。
- 保持されたキャリブレーションセットを用いて、尤度表現(例:「中程度の可能性」を確率にマッピング)を最適化し、キャリブレーションを向上させる。この手法は「Ling. 1S-opt」として呼ばれる。
- 複数のベンチマークとモデルにおいて、言語的自信スコアをモデルの対数尤度、エントロピー、その他のベースラインと比較する。

実験結果
リサーチクエスチョン
- RQ1GPT-3.5-turbo、GPT-4、Claude 2 などのRLHFでファインチューニングされた言語モデルは、内部の対数尤度に依存するのではなく、不確実性を言語的に表現することで、より良好にキャリブレーションされた自信推定を実現できるか?
- RQ2自信スコアを割り当てる前に複数の回答候補を生成するようにモデルにプロンプトすることで、言語的自信表現のキャリブレーションが向上するか?
- RQ3異なるモデルとデータセットにおいて、言語的数値確率(例:「70%」)と言語的不確実性表現(例:「ありそう」「ありえない」)のキャリブレーションは、どのように比較されるか?
- RQ4温度スケーリングは、RLHF言語モデルにおける言語的自信スコアのキャリブレーションをどの程度向上させるか?
- RQ5GPT-4 や Claude 2 といった閉鎖型モデルと比較して、Llama-2-70b-chat といったオープンソースモデルの言語的表現能力は、自信キャリブレーションの観点でどの程度優れているか?
主な発見
- GPT-3.5-turbo、GPT-4、Claude 2 では、SciQ ベンチマークにおいて、モデルの対数尤度と比較して、言語的自信スコアが期待キャリブレーション誤差(ECE)を50%以上低減した。
- 評価されたすべてのモデルとベンチマークにおいて、言語的数値確率がモデルの対数尤度よりも一貫して良好にキャリブレーションされた。特に、敵対的で難しいTruthfulQAデータセットで最も顕著な改善が見られた。
- 自信スコアを割り当てる前に複数の回答仮説を生成・評価することで、キャリブレーションが著しく向上し、単一仮説プロンプティングと比較してECEが最大50%まで低減された。
- 温度スケーリングにより、特に GPT-3.5-turbo と GPT-4 において、言語的確率のキャリブレーションがさらに向上したが、その効果はモデルごとに異なった。
- Claude 2 は Claude 1 よりも優れた言語的表現能力を示し、GPT-4 は GPT-3.5-turbo よりも言語的自信キャリブレーションで優れていたが、両者とも自らの対数尤度よりも優れた結果を出した。
- Llama-2-70b-chat は閉鎖型モデルに比べて言語的表現能力に劣るが、特にTruthfulQAにおいて対数尤度よりもキャリブレーションが向上しており、オープンソースモデルの改善の可能性を示唆している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。