[论文解读] Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
Chatbot Arena 是一个开放的、实时的基准测试平台,通过众包的成对比较方式评估大型语言模型(LLMs)在真实用户问题上的响应表现。该平台利用超过240,000次互动中的人类偏好投票,结合布拉德利-特勒(Bradley-Terry)模型和E值等统计模型,高效且可靠地对模型进行排名,建立了一个可信且动态的替代方案,相较于静态的、基于准确率的基准测试,其结果与专家评分具有高度一致性。
Constraint Programming (CP) and Machine Learning (ML) face challenges in text generation due to CP’s struggle with implementing "meaning" and ML’s difficulty with structural constraints. This paper proposes a solution by combining both approaches and embedding a Large Language Model (LLM) in CP. The LLM handles word generation and meaning, while CP manages structural constraints. This approach builds on GenCP, an improved version of On-the-fly Constraint Programming Search (OTFS) using LLM-generated domains. Compared to Beam Search (BS), a standard NLP method, this combined approach (GenCP with LLM) is faster and produces better results, ensuring all constraints are satisfied. This fusion of CP and ML presents new possibilities for enhancing text generation under constraints.
研究动机与目标
- 解决静态、基于准确率的基准测试在评估 LLM 与人类偏好在现实世界中对齐程度方面的局限性。
- 创建一个可扩展、开放且实时的评估平台,真实反映用户互动和多样化、新颖的提示。
- 通过将众包投票与专家评分进行对比,并分析提示的多样性和质量,确保高质量的人类偏好数据。
- 开发高效、样本最优的采样算法,加速模型排名的收敛过程,同时保持统计有效性。
- 建立一个公开可访问的开源基准,成为 LLM 研究和产业界广泛引用的标准。
提出的方法
- 采用实时、匿名的成对对抗模式,用户在不知情的情况下对两个 LLM 响应进行投票。
- 通过公共网站收集真实用户问题和响应,确保提示的多样性和新鲜度。
- 应用布拉德利-特勒(Bradley-Terry)模型,从成对投票数据中估算模型之间的相对偏好得分。
- 使用 Vovk & Wang(2021)提出的 E 值来评估模型比较的统计显著性和可靠性。
- 实施受主动学习启发的采样算法,选择信息增益最大的模型对,以加速排名收敛。
- 通过将众包投票与专家标注进行对比,验证数据质量,确认其高度一致性和可靠性。
实验结果
研究问题
- RQ1实时的、众包的成对比较系统在捕捉 LLM 响应人类偏好的细微差别方面有多有效?
- RQ2Chatbot Arena 上的众包投票在多大程度上与专家人类评估者在模型质量评估上保持一致?
- RQ3平台上收集的用户生成提示在多大程度上能够反映现实世界中 LLM 的应用场景?
- RQ4像布拉德利-特勒和 E 值这样的统计模型能否可靠地从嘈杂的、现实世界的人类偏好数据中估计模型排名?
- RQ5与随机或固定配对相比,主动采样策略在模型评估中如何提升样本效率?
主要发现
- 自2023年4月以来,平台已收集来自约90,000名用户、超过100种语言的240,000多次人类偏好投票。
- 众包投票与专家评估结果高度一致,证实了人类偏好数据的可靠性和可信度。
- 用户生成的提示具有足够的多样性和挑战性,有效覆盖了现实世界中 LLM 应用的广泛场景。
- 主动采样算法显著提升了样本效率,在保持统计有效性的前提下加速了模型排名的收敛。
- 该平台已成为研究和产业界引用最广泛的 LLM 排行榜之一,截至2024年3月,网站访问量已超过100万次。
- 该团队计划公开发布一个包含超过100,000次成对投票的人类偏好数据集,以支持未来的研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。