[论文解读] RewardBench: Evaluating Reward Models for Language Modeling
RewardBench 引入了一个全面的基准数据集和代码库,用于评估强化学习从人类反馈(RLHF)中用于语言建模的奖励模型(RMs)。它在安全、推理和对话领域,对结构化、分布外的提示评估了多种 RMs——包括基于分类器和通过直接偏好优化(DPO)训练的模型——揭示了其在拒绝行为、推理能力和泛化能力方面的关键局限,尤其是 DPO 模型在标准测试集上的表现。
Reward models (RMs) are at the crux of successfully using RLHF to align pretrained models to human preferences, yet there has been relatively little study that focuses on evaluation of those models. Evaluating reward models presents an opportunity to understand the opaque technologies used for alignment of language models and which values are embedded in them. Resources for reward model training and understanding are sparse in the nascent open-source community around them. To enhance scientific understanding of reward models, we present RewardBench, a benchmark dataset and code-base for evaluation. The RewardBench dataset is a collection of prompt-chosen-rejected trios spanning chat, reasoning, and safety, to benchmark how reward models perform on challenging, structured and out-of-distribution queries. We create specific comparison datasets for RMs that have subtle, but verifiable reasons (e.g. bugs, incorrect facts) why one answer should be preferred to another. On the RewardBench leaderboard, we evaluate reward models trained with a variety of methods, such as the direct MLE training of classifiers and the implicit reward modeling of Direct Preference Optimization (DPO). We present many findings on propensity for refusals, reasoning limitations, and instruction following shortcomings of various reward models towards a better understanding of the RLHF process.
研究动机与目标
- 为解决奖励模型(RMs)缺乏系统性评估的问题,尽管 RMs 在 RLHF 中至关重要,但其研究仍显不足,尤其是在对齐大语言模型与人类偏好方面。
- 创建一个统一的基准数据集和代码库,用于在结构化、分布外的查询上评估多种 RMs 架构,包括基于分类器和 DPO 训练的模型。
- 通过在标准排行榜上评估多样化的、经人工验证的提示-选择/拒绝三元组,绘制当前开源权重奖励模型的现状。
- 研究 RMs 在偏好评估集上的泛化能力和鲁棒性,特别是 DPO 基模型在完成内容间存在细微、可验证差异的测试集上的表现。
- 发布一个可复现的评估框架,包含完整数据、推理工具和可视化支持,以促进对 RMs 行为和对齐特性的深入分析。
提出的方法
- 作者在三个领域(对话、推理和安全)中整理了一个基准数据集,包含经人工验证的首选和次选完成文本的提示-胜-负三元组。
- 每个数据点以一个提示配对一个被选中(首选)和一个被拒绝(次选)的完成形式呈现,其设计旨在测试细微差异,如事实错误、逻辑缺陷或伦理问题。
- 该基准包含简单样本(顶尖 RMs 准确率接近 100%)和困难样本(即使顶尖模型准确率也仅达 60–70%),以评估模型的鲁棒性。
- 评估框架支持对广泛 RMs 的推理,包括通过直接最大似然估计(MLE)分类训练的模型(如 UltraRM、Starling)和 DPO 微调的模型(如 Zephyr、Qwen-Chat、Tulu 2)。
- 在 HF.co/spaces/allenai/reward-bench 上维护一个公开排行榜,支持持续的模型对比和跨数据集性能追踪。
- 代码库提供统一的推理堆栈、可视化工具,以及所有文本-分数对的访问权限,以支持对 RMs 行为和决策边界的进一步分析。

实验结果
研究问题
- RQ1在多样化的、分布外的偏好评估任务中,基于分类器的奖励模型与 DPO 训练的模型在泛化能力和鲁棒性方面有何差异?
- RQ2奖励模型在多大程度上表现出拒绝行为?这种行为在不同类型提示(如敏感话题、假设性暴力)中如何变化?
- RQ3当前奖励模型在推理和事实一致性方面存在哪些局限?特别是在面对完成内容中细微的逻辑或事实错误时?
- RQ4DPO 基模型在标准偏好评估基准上的表现如何?它们是否能超越其微调数据分布实现泛化?
- RQ5奖励模型的关键失败模式是什么?这些失败模式与特定提示类别(如安全、推理或指令遵循)是否存在关联?
主要发现
- 尽管 DPO 训练的模型广受欢迎且训练简便,但其性能波动更大,且在标准偏好评估测试集上泛化能力较差。
- 基于分类器的奖励模型(如 UltraRM 和 Starling)在相同基准上持续优于 DPO 模型,尤其在困难的、分布外的样本上表现更优。
- 许多奖励模型在涉及暴力或敏感话题的提示上表现出极高的拒绝率,即使提示是虚构或假设性的,表明其安全对齐存在过度敏感问题。
- 在 XSTest Should Respond 子集上,模型经常拒绝回答,即使提示本身无害或为虚构情境,揭示其在模糊或边缘情况下的过度拒绝倾向。
- 顶尖模型在最具挑战性的样本上准确率仅为 60–70%,表明当前 RMs 在处理细微推理和事实一致性方面仍存在困难。
- 该基准揭示,即使高性能 RMs 也会在存在微小事实错误或逻辑不一致的提示上失败,表明奖励模型可能无法可靠捕捉人类偏好的细微差别。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。