[論文レビュー] Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
Chatbot Arena は、実際のユーザーの質問に対するモデルの応答を対比評価する形で、大規模言語モデル(LLMs)を人間の好みの投票に基づいて評価するオープンでライブなベンチマークプラットフォームを提供する。240,000件を超える相互作用からの人間の好みの投票を活用し、Bradley-Terry モデルや E 値といった統計モデルを用いて、モデルの順位付けを効率的かつ信頼性高く実施することで、専門家評価との高い一貫性を示す、静的で正確性に基づくベンチマークとは対照的な、信頼性のある動的代替手段を確立する。
Constraint Programming (CP) and Machine Learning (ML) face challenges in text generation due to CP’s struggle with implementing "meaning" and ML’s difficulty with structural constraints. This paper proposes a solution by combining both approaches and embedding a Large Language Model (LLM) in CP. The LLM handles word generation and meaning, while CP manages structural constraints. This approach builds on GenCP, an improved version of On-the-fly Constraint Programming Search (OTFS) using LLM-generated domains. Compared to Beam Search (BS), a standard NLP method, this combined approach (GenCP with LLM) is faster and produces better results, ensuring all constraints are satisfied. This fusion of CP and ML presents new possibilities for enhancing text generation under constraints.
研究の動機と目的
- LLMs の人間の好みへの実世界での整合性を評価する上で、静的で正確性に基づくベンチマークの限界を是正すること。
- 実際のユーザーの相互作用と多様で新鮮なプロンプトを反映する、スケーラブルでオープンでライブな評価プラットフォームを構築すること。
- クラウドの投票を専門家レーティングと照合し、プロンプトの多様性と質を分析することで、高品質な人間の好みデータを保証すること。
- 収束を加速させつつ統計的妥当性を保持する、サンプル最適化のサンプリングアルゴリズムを効率的に開発すること。
- 一般に公開され、オープンソースのベンチマークを確立し、LLM分野の研究および産業界で広く参照される基準とする。
提案手法
- ユーザーがモデルの識別子を知らずに、2つの LLM 応答のうちどちらがより良いと感じるかを匿名で選択する、ライブで匿名のペアワイズバトル形式を採用する。
- 公開ウェブサイトを通じて実際のユーザーの質問と応答を収集し、プロンプトの多様性と新鮮さを保証する。
- ペアワイズ投票データから相対的な好みスコアを推定するために Bradley-Terry モデルを適用する。
- Vovk & Wang (2021) が提唱する E 値を用いて、モデル比較の統計的有意性と信頼性を評価する。
- アクティブラーニングにインspiredされたサンプリングアルゴリズムを実装し、情報量の多いモデルペアの選択によって順位付けの収束を加速する。
- クラウドの投票を専門家アノテーションと照合することでデータ品質を検証し、高い一致度と一貫性を確認する。
実験結果
リサーチクエスチョン
- RQ1ライブでクラウドソーシングされたペアワイズ比較システムは、LLM 応答に対する人間の好みの微細な側面をどれほど的確に捉えられるか?
- RQ2Chatbot Arena におけるクラウドソーシングされた投票は、モデル品質の評価において、専門家レーティングとどの程度一致するか?
- RQ3プラットフォームで収集されたユーザー生成プロンプトは、実世界の LLM 用途をどれほど多様かつ代表的に反映しているか?
- RQ4Bradley-Terry モデルや E 値といった統計モデルは、ノイズが多く現実世界の人の好みデータからも、モデル順位を信頼性高く推定できるか?
- RQ5アクティブサンプリング戦略は、ランダムまたは固定ペアリングと比較して、どの程度サンプル効率を向上させるか?
主な発見
- 2023年4月以降、100ヶ国語以上、約90,000人のユーザーが240,000件を超える人間の好みの投票を提供した。
- クラウドソーシングされた投票は専門家評価と強く一致しており、人間の好みデータの信頼性と信ぴょう性を裏付けている。
- ユーザーが生成したプロンプトは十分に多様で、実世界の LLM 応用分野やユースケースを幅広くカバーしている。
- アクティブサンプリングアルゴリズムは、サンプル効率を顕著に向上させ、統計的妥当性を保持したまま順位付けの収束を加速させた。
- 2024年3月現在、100万件を超えるウェブサイトのアクセスを記録し、研究および産業界で最も広く引用される LLM ランキングの一つとなった。
- 研究チームは、プラットフォームから得た100,000件を超えるペアワイズ投票を含む人間の好みデータセットを、今後一般公開する予定である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。