[论文解读] Human Feedback is not Gold Standard
本文挑战了人类反馈作为评估或训练大语言模型的可靠黄金标准这一假设。研究发现,偏好分数——常用于模型评估和强化学习人类反馈(RLHF)——未能充分反映事实性,且受诸如确定性等混淆因素的影响,导致模型更加武断但事实准确性更低。研究揭示,人类标注并非完全客观或全面,因此在依赖人类反馈作为主要训练目标时需保持谨慎。
Human feedback has become the de facto standard for evaluating the performance of Large Language Models, and is increasingly being used as a training objective. However, it is not clear which properties of a generated output this single `preference' score captures. We hypothesise that preference scores are subjective and open to undesirable biases. We critically analyse the use of human feedback for both training and evaluation, to verify whether it fully captures a range of crucial error criteria. We find that while preference scores have fairly good coverage, they under-represent important aspects like factuality. We further hypothesise that both preference scores and error annotation may be affected by confounders, and leverage instruction-tuned models to generate outputs that vary along two possible confounding dimensions: assertiveness and complexity. We find that the assertiveness of an output skews the perceived rate of factuality errors, indicating that human annotations are not a fully reliable evaluation metric or training objective. Finally, we offer preliminary evidence that using human feedback as a training objective disproportionately increases the assertiveness of model outputs. We encourage future work to carefully consider whether preference scores are well aligned with the desired objective.
研究动机与目标
- 调查人类反馈是否可靠地捕捉了事实性与一致性等关键质量标准,而这些标准被广泛用作评估和训练大语言模型的黄金标准。
- 评估偏好分数是否充分代表了模型输出中的关键错误类型,如事实性、不一致性和重复性。
- 检验诸如确定性与复杂性等混淆因素是否对人类标注者的判断产生偏差。
- 评估将人类反馈用作训练目标对模型输出特征(尤其是确定性)的影响。
- 提供证据表明,参考回复常被评定为低于模型生成的输出,从而质疑基于参考的评估的有效性。
提出的方法
- 定义了一组与任务无关的错误标准(如事实性、不一致性、重复性、拒绝响应),作为模型输出的最低质量要求。
- 在两种条件下收集人类标注:一种是标注者独立评估整体质量,另一种是先评估特定错误类型,以检验提示效应。
- 使用指令微调的大语言模型(Cohere、Falcon、MPT、Command)生成在确定性与复杂性上具有受控差异的模型输出,以探测混淆效应。
- 测量错误标注与整体偏好分数之间的相关性,以评估覆盖度与偏差。
- 分析响应长度与质量评分之间的关系,识别出长度与重复性或事实性错误之间的权衡。
- 比较模型输出与参考回复在质量评分上的表现,以评估基于参考的基准的有效性。

实验结果
研究问题
- RQ1在人类评估中使用的偏好分数是否充分覆盖了大语言模型输出中的关键错误类型,如事实性与不一致性?
- RQ2人类对模型质量的标注在多大程度上受到响应中确定性与复杂性等混淆因素的影响?
- RQ3将人类反馈用作训练目标是否导致模型确定性出现不成比例的增加?
- RQ4人类标注者的整体质量判断与具体错误类型之间的相关性如何?当先呈现错误标准时,是否存在提示效应?
- RQ5参考回复是否始终被评定为比模型生成的输出质量更高?这对评估基准意味着什么?
主要发现
- 偏好分数对错误类型的覆盖尚可,但显著低估了事实性与忠实性错误,表明其用作黄金标准的可靠性有限。
- 标注者对事实性的评估强烈受模型响应确定性的影响:更武断的输出即使错误,也被认为更具有事实性。
- 存在可测量的提示效应:先评估特定错误类型的标注者,其整体质量评分与这些错误类型的相关性更强,表明错误标准的呈现顺序影响了最终判断。
- 标注者倾向于偏好一定长度内的响应,但随着长度增加,重复性与事实性错误率也上升,表明响应质量存在权衡。
- 参考回复在整体质量评分上始终低于模型生成的输出,挑战了参考作为有效基准的假设。
- 初步证据表明,使用人类反馈作为奖励信号进行微调,会不成比例地提高模型输出的确定性,可能以牺牲事实准确性为代价。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。