Skip to main content
QUICK REVIEW

[論文レビュー] WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild

Bill Yuchen Lin, Yuntian Deng|arXiv (Cornell University)|Jun 7, 2024
Recommender Systems and Techniques被引用数 4
ひとこと要約

WildBench は、ライブチャットインタラクションから収集された 1,024 件の実世界のユーザークエリを用いて、大規模言語モデル(LLM)を評価する動的で自動化されたベンチマークを導入する。LLM-as-judge を用い、タスク固有のチェックリストと構造的推論を組み合わせることで、WB-Reward(対比較)および WB-Score(個別スコア)による解釈可能で信頼性の高いスコアを生成し、人間の判断とそれぞれ 0.98 および 0.95 のピアソン相関を達成。既存のベンチマークを上回る性能を発揮する。

ABSTRACT

We introduce WildBench, an automated evaluation framework designed to benchmark large language models (LLMs) using challenging, real-world user queries. WildBench consists of 1,024 tasks carefully selected from over one million human-chatbot conversation logs. For automated evaluation with WildBench, we have developed two metrics, WB-Reward and WB-Score, which are computable using advanced LLMs such as GPT-4-turbo. WildBench evaluation uses task-specific checklists to evaluate model outputs systematically and provides structured explanations that justify the scores and comparisons, resulting in more reliable and interpretable automatic judgments. WB-Reward employs fine-grained pairwise comparisons between model responses, generating five potential outcomes: much better, slightly better, slightly worse, much worse, or a tie. Unlike previous evaluations that employed a single baseline model, we selected three baseline models at varying performance levels to ensure a comprehensive pairwise evaluation. Additionally, we propose a simple method to mitigate length bias, by converting outcomes of ``slightly better/worse'' to ``tie'' if the winner response exceeds the loser one by more than $K$ characters. WB-Score evaluates the quality of model outputs individually, making it a fast and cost-efficient evaluation metric. WildBench results demonstrate a strong correlation with the human-voted Elo ratings from Chatbot Arena on hard tasks. Specifically, WB-Reward achieves a Pearson correlation of 0.98 with top-ranking models. Additionally, WB-Score reaches 0.95, surpassing both ArenaHard's 0.91 and AlpacaEval2.0's 0.89 for length-controlled win rates, as well as the 0.87 for regular win rates.

研究の動機と目的

  • 既存の LLM ベンチマークが合成的または狭いタスク分布に依存するという限界を是正するため、ライブチャットインタラクションから得た実際の、多様で挑戦的なユーザークエリを用いること。
  • 人間の労働を最小限に抑えつつ人間の好みと高い整合性を保つ、自動化可能でスケーラブルかつ解釈可能な評価フレームワークを開発すること。
  • 特に長さバイアスに起因する共通のバイアスを低減するため、動的長さペナルティメカニズムを用いて LLM-as-judge 評価におけるバイアスを是正すること。
  • WildChat プロジェクトからの新しい未観測ユーザーデータを継続的に統合することで、データの新鮮さを確保し、漏洩リスクを低減すること。
  • 公開された検証データと詳細な構築手順を提供することで、透明性があり汚染に強くない評価プラットフォームを提供すること。

提案手法

  • WildBench は、WildChat データセットに含まれる 100 万件を超える実際のユーザー・チャットボット対話ログから、1,024 件の挑戦的タスクを収集し、複数の LLM 分析と手作業レビューを用いて簡単なタスクを除外する。
  • LLM 評価者による構造的で段階的な正当化を生成するため、Chain-of-Thought(CoT)に類似したプロンプト戦略を採用。タスク固有のチェックリストを用いて応答品質を評価する。
  • WB-Reward は、5 つの結果(はるかに良い、やや良い、同点、やや悪い、はるかに悪い)に基づき、モデル出力同士を対比較する。一貫性のある評価のため、1 つのベースラインモデルではなく 3 つのベースラインモデルを用いる。
  • WB-Score は、個別にモデル出力を評価することで、対比較を伴わない高速でコスト効率の高いモデル品質評価を可能にする。
  • 長さペナルティメカニズムにより、勝者が出力長で敗者を K 文字以上上回る場合、'やや良い' や 'やや悪い' の結果が '同点' に変換される。これにより、長さバイアスの影響が軽減される。
  • データ漏洩を防ぐためにプライベートホールドアウトセットを用い、検証セットと構築プロセスを公開することで透明性を確保する。
Figure 1: Evaluation framework for WildBench .
Figure 1: Evaluation framework for WildBench .

実験結果

リサーチクエスチョン

  • RQ1実世界のオープンエンドユーザークエリを対象とした自動化された LLM-as-judge フレームワークは、人間の好みの判断と高い相関を達成できるか?
  • RQ2対比較評価において複数のベースラインモデルを用いることで、単一ベースラインアプローチと比較して、評価の頑健性と包括性がどのように向上するか?
  • RQ3LLM 評価者における構造的チェックリストと段階的推論の使用が、自動評価における曖昧性の低減と解釈可能性の向上にどの程度寄与するか?
  • RQ4動的長さペナルティメカニズムは、LLM-as-judge 評価でよく知られた長さバイアスをどの程度効果的に是正できるか?
  • RQ5実際のユーザーデータを継続的に更新するベンチマークは、静的で閉鎖的なベンチマークに比べ、関連性を維持し、モデル汚染を効果的に防げるか?

主な発見

  • WB-Reward は、Chatbot Arena で得られた人間投票 Elo 評価と、ハードタスクにおいて 0.98 のピアソン相関を達成し、人間の好みとほぼ完全に一致していることを示している。
  • WB-Score は人間の判断と 0.95 の相関を達成し、ArenaHard の 0.91 や AlpacaEval2.0 の長さ制御された勝率 0.89 を上回っている。
  • このベンチマークは、コーディング、数学、推論など多様なタスクカテゴリで優れた性能を示しており、詳細なスコア分解により、モデルの強みと弱みが明確に特定されている。
  • 対比較評価において 3 つのベースラインモデルを用いることで、単一ベースラインアプローチに比べてより洗練され包括的な評価が可能となり、モデルの性能差がより明確に捉えられるようになった。
  • 長さペナルティメカニズムは、出力長が判断に与える影響を効果的に低減し、自動評価の公平性と信頼性を向上させた。
  • WildBench ランキングはリリース後、20,000 回以上のアクセスを記録しており、研究コミュニティにおける高い採用率と実用性を示している。
Figure 2: Distribution of query lengths in AlpacaEval, ArenaHard, and WildBench.
Figure 2: Distribution of query lengths in AlpacaEval, ArenaHard, and WildBench.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。