Skip to main content
QUICK REVIEW

[論文レビュー] Can You Trust LLM Judgments? Reliability of LLM-as-a-Judge

Kayla Schroeder, Zach Wood-Doughty|arXiv (Cornell University)|Dec 17, 2024
Legal Systems and Judicial Processes被引用数 4
ひとこと要約

本論文は、LLM-as-a-judgeシステムの内部整合性信頼性を評価するためのきめ細やかな統計枠組みを提示する。マクドナルドのオメガを用いて、固定温度設定下でも単一ショットLLM判断に顕著なばらつきが生じることを示し、AIセーフティやコンテンツモデレーションなどのハイステイクスな応用分野における信頼できる評価のためには信頼性指標が不可欠であることを明らかにする。

ABSTRACT

Large Language Models (LLMs) have become increasingly powerful and ubiquitous, but their stochastic nature poses challenges to the reliability of their outputs. While deterministic settings can improve consistency, they do not guarantee reliability, as a single sample from the model's probability distribution can still be misleading. Building upon the concept of LLM-as-a-judge, we introduce a novel framework for rigorously evaluating the reliability of LLM judgments, leveraging McDonald's omega. We evaluate the reliability of LLMs when judging the outputs of other LLMs on standard single-turn and multi-turn benchmarks, simultaneously investigating the impact of temperature on reliability. By analyzing these results, we demonstrate the limitations of fixed randomness and the importance of considering multiple samples, which we show has significant implications for downstream applications. Our findings highlight the need for a nuanced understanding of LLM reliability and the potential risks associated with over-reliance on single-shot evaluations. This work provides a crucial step towards building more trustworthy and reliable LLM-based systems and applications.

研究の動機と目的

  • AIセーフティやコンテンツモデレーションなどのハイステイクスな応用分野において、LLM-as-a-judgeシステムの信頼性を評価するという重要なギャップを埋めること。
  • 固定温度(固定温度)設定によっても信頼できるLLM判断が保証されるという仮定に疑問を呈すること。
  • マクドナルドのオメガを、LLM判断における内部整合性信頼性を定量化するための強固で統計的に裏付けられた指標として導入すること。
  • 高信頼性値であっても、特に複雑な複数ターンタスクでは、繰り返し実行におけるばらつきが解消されないことを実証すること。
  • LLM-as-a-judgeの結果に加えて信頼性指標を報告することで、AI評価における透明性と信頼性を向上させることを提唱すること。

提案手法

  • 同じ入力に対して複数のLLM判断における内部整合性を測定するための主な信頼性指標としてマクドナルドのオメガを採用する。
  • BBH、SQuAD、MT-Bench、Head-to-Tailを含む、標準的な単ターンおよびマルチターンベンチマークにこの枠組みを適用する。
  • 確率的要因への感受性を評価するため、さまざまな温度設定下でのLLM判断を評価する。固定設定下でも、ばらつきが生じる可能性がある。
  • 各入力に対して複数の判断を収集し、信頼性スコアを計算することで、繰り返し評価を模擬し、ばらつきを捉える。
  • 統計的推論を用いて、LLM判断における不確実性を報告する。これは、従来の研究における信頼区間と類似したアプローチである。
  • 異なるベンチマークおよびタスクタイプ間での信頼性スコアを比較し、判断の不安定性のパターンを同定する。

実験結果

リサーチクエスチョン

  • RQ1固定温度設定下でも、繰り返し実行においてLLM-as-a-judgeの出力はどの程度信頼できるのか?
  • RQ2温度設定が、さまざまなベンチマークタイプにおけるLLM-as-a-judge出力の信頼性にどのように影響するか?
  • RQ3マクドナルドのオメガは、主観的で複雑な評価タスクにおけるLLM判断の内部整合性信頼性を効果的に定量化できるか?
  • RQ4信頼性スコアは、下流のLLM評価結果における観察されたばらつきとどの程度相関するか?
  • RQ5低信頼性が、AIセーフティやコンテンツモデレーションなどの実世界の応用分野に及ぼす影響は何か?

主な発見

  • 固定温度設定下でも、LLM-as-a-judgeの出力は繰り返し実行において顕著なばらつきを示しており、決定論的設定が信頼性を保証するわけではないことが示された。
  • マクドナルドのオメガを用いた信頼性スコアは、ベンチマーク間で顕著な差を示しており、マルチターンおよび複雑なタスクでは特に低い信頼性が見られた。
  • 図3で示されるように、高信頼性のモデルであっても、繰り返し実行において一貫性のない判断を生じることがあり、高信頼性値がばらつきを排除しないことが実証された。
  • 本研究では、単一ショット評価では、主観的またはハイステイクスな分野におけるLLM判断の信頼性を確保するには不十分であることが判明した。
  • LLM-as-a-judgeの結果に加えて信頼性指標を報告することで、モデル出力に内在する不確実性についてユーザーに情報提供すべきである。
  • 本フレームワークは、信頼性がLLM評価における重要な、定量可能な次元であることを示しており、研究および実装プロセスに統合されるべきである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。