[論文レビュー] Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement
本稿では、信頼度推定に基づいて動的に判断モデルを選択することで、LLMベースの対比較評価において人間の合意を保証する、Cascaded Selective Evaluationという手法を提案する。シミュレーテッド・アノテーターを用いた補正済み信頼度スコアリングにより、79.1%のカバレッジで80%以上の人的合意を達成し、GPT-4を上回る性能を発揮するとともに、コストを最大87.4%まで削減する。
We present a principled approach to provide LLM-based evaluation with a rigorous guarantee of human agreement. We first propose that a reliable evaluation method should not uncritically rely on model preferences for pairwise evaluation, but rather assess the confidence of judge models and selectively decide when to trust its judgement. We then show that under this selective evaluation framework, human agreement can be provably guaranteed -- such that the model evaluation aligns with that of humans to a user-specified agreement level. As part of our framework, we also introduce Simulated Annotators, a novel confidence estimation method that significantly improves judge calibration and thus enables high coverage of evaluated instances. Finally, we propose Cascaded Selective Evaluation, where we use cheaper models as initial judges and escalate to stronger models only when necessary -- again, while still providing a provable guarantee of human agreement. Experimental results show that Cascaded Selective Evaluation guarantees strong alignment with humans, far beyond what LLM judges could achieve without selective evaluation. For example, on a subset of Chatbot Arena where GPT-4 almost never achieves 80% human agreement, our method, even while employing substantially cost-effective models such as Mistral-7B, guarantees over 80% human agreement with almost 80% test coverage.
研究の動機と目的
- LLMベースの評価における妥当性の欠如に取り組む。これは、信頼度の評価なしにモデルの好みに無批判的依存する傾向があるためである。
- ユーザーが指定したリスク水準αにおいて、人間の合意を保証するフレームワークを開発する。これにより、モデルの判断が人間の合意に一致することを保証する。
- 外部監視が存在しない状況においても、LLM判断者の信頼度推定を改善し、信頼性を損なわせることなく評価カバレッジを最大化する。
- 信頼度が低い場合にのみ上位のモデルにエスカレートする段階的評価フレームワークを用いることで、推論コストを削減しながらも、人間の判断との高い合意を維持する。
- 弱く安価なモデルが、適切な信頼度補正と選択的評価を組み合わせることで、GPT-4のような強力なモデルを上回ることを示す。
提案手法
- 選択的評価をフレームワークとして提案。LLM判断者が、信頼度推定に基づき、好みに対する自信が十分に高い場合にのみ信頼される。
- シミュレーテッド・アノテーターを導入。これは、文脈学習を用いて多様なアノテーターの好みをシミュレートし、複数のシミュレーションにおける一致率として信頼度を計算する、新規の非教師付き信頼度推定手法である。
- 固定シーケンステスト(Bauer, 1991)を小さな補正用データセットに適用し、不一致リスクの確実な上限を導出し、人間の合意を確率的に1−α以上で保証する。
- Cascaded Selective Evaluationを設計。安価なモデル(例:Mistral-7B)を初期判断者として用い、信頼度が低い場合はより強力なモデルにエスカレートする。この際も人間の合意保証を維持する。
- ユーザーが指定したリスク許容度αに基づき、最適な放棄ポリシーを自動で決定し、ヒューリスティックなモデル選択の必要性を排除する。
- モデルに依存しないアプローチを採用。信頼度が適切に推定・補正されていれば、任意のLLMを判断者として利用可能である。

実験結果
リサーチクエスチョン
- RQ1弱いかつ安価なモデルを用いても、ユーザーが指定した信頼度水準でLLMベースの評価が人間の判断と一致することを保証できるか?
- RQ2外部監視やラベル付きデータに依存せずに、LLM判断者の信頼度推定をどのように改善できるか?
- RQ3段階的評価フレームワークを用いることで、最も強力なモデルを単独で使用する場合と比較して、推論コストを削減しながらも、人間の合意を維持または向上できるか?
- RQ4補正済み信頼度に基づく放棄ポリシーは、長さやトークンの重複といった表面的特徴ではなく、人間の主観的難易度の認識と一致するか?
- RQ5従来の信頼度推定手法(例:予測確率)と比較して、シミュレーテッド・アノテーターは補正精度と失敗予測能力で優れているか?
主な発見
- Cascaded Selective Evaluationは、Chatbot Arenaベンチマークにおいて、Mistral-7BとGPT-3.5のみを判断者として用いても、80%を超える人的合意を保証する。これは、放棄なしのGPT-4を上回る。
- 本手法は、Chatbot Arenaで79.1%のテストカバレッジを達成しながらも、80%を超える人的合意を維持する。これは、放棄なしのGPT-4の77.8%の合意率を大きく上回る。
- 弱いモデルの段階的評価(Mistral-7B、Mixtral-8×7B、GPT-3.5)を用いることで、GPT-4と比較して評価コストを87.4%まで削減し、同時に80.3%の人的合意を達成する。
- シミュレーテッド・アノテーターは、予測確率のようなベースライン手法と比較して、信頼度の補正精度と失敗予測能力を著しく向上させる。予測確率は人間の合意を過剰に推定する傾向がある。
- 放棄ポリシーは、長さ比やトークンの重複といった単純なヒューリスティックではなく、人間の主観的難易度の認識と密接に一致する。
- 固定シーケンステストを補正用データセットに適用することで、本フレームワークは人的合意の確実な保証を提供する。これにより、任意の未観測インスタンスについて、不一致の確率がα未満に抑えられる。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。