Skip to main content
QUICK REVIEW

[论文解读] Training Language Models with Language Feedback

Jérémy Scheurer, Jon Ander Campos|arXiv (Cornell University)|Apr 29, 2022
Topic Modeling被引用 11
一句话总结

本文提出一种三步法,通过自然语言反馈而非成对比较来微调语言模型,使模型能够基于人类反馈优化初始生成结果,从而生成更高质量的输出。仅使用100个由人类编写的反馈示例,该方法在GPT-3(175B参数)上实现了人类水平的摘要性能,证明了大模型能够有效整合详细反馈以提升输出质量。

ABSTRACT

Pretrained language models often do not perform tasks in ways that are in line with our preferences, e.g., generating offensive text or factually incorrect summaries. Recent work approaches the above issue by learning from a simple form of human evaluation: comparisons between pairs of model-generated task outputs. Comparison feedback conveys limited information about human preferences per human evaluation. Here, we propose to learn from natural language feedback, which conveys more information per human evaluation. We learn from language feedback on model outputs using a three-step learning algorithm. First, we condition the language model on the initial output and feedback to generate many refinements. Second, we choose the refinement with the highest similarity to the feedback. Third, we finetune a language model to maximize the likelihood of the chosen refinement given the input. In synthetic experiments, we first evaluate whether language models accurately incorporate feedback to produce refinements, finding that only large language models (175B parameters) do so. Using only 100 samples of human-written feedback, our learning algorithm finetunes a GPT-3 model to roughly human-level summarization ability.

研究动机与目标

  • 解决偏好学习中成对比较反馈的局限性,后者每次人类评估传递的信息量极少。
  • 探究是否更丰富的自然语言反馈(信息量更丰富)能够提升语言模型与人类偏好的对齐程度。
  • 开发一种可扩展的、非强化学习的方法,利用人工编写的反馈微调语言模型。
  • 评估大语言模型是否能够准确理解并应用复杂反馈以优化输出。

提出的方法

  • 以输入、初始输出和人工编写的反馈为条件,微调大语言模型,生成多个优化版本。
  • 基于嵌入相似度对每个优化版本进行评分,选择得分最高的版本。
  • 在选定的优化版本上微调语言模型,以最大化在给定输入下生成这些版本的可能性。
  • 采用三步流程:优化版本生成、反馈感知选择、监督微调。
  • 利用大模型的指令遵循能力,以理解并响应自然语言反馈。
  • 避免使用强化学习或辅助损失,实现对自然语言反馈的直接应用。

实验结果

研究问题

  • RQ1大语言模型能否准确地将详细自然语言反馈融入其输出优化中?
  • RQ2在受控的合成任务中,反馈整合性能如何随模型规模变化,尤其是小规模模型的表现如何?
  • RQ3少量人工编写的反馈示例(例如100个)是否足以在摘要任务中实现人类水平的性能?
  • RQ4与基线方法或无反馈方法相比,反馈感知的优化版本选择在多大程度上提升了输出质量?
  • RQ5语言模型生成的优化版本在多大程度上反映了人工反馈的意图和内容?

主要发现

  • 仅最大的GPT-3模型(175B参数)在合成的删除不当词汇任务中准确地整合了反馈,优化版本准确率为38.5%。
  • 较小的模型(如Ada、Babbage、Curie)准确率显著更低,平均值低于2.5%。
  • 仅使用100个人工编写的反馈样本,该方法在51%的案例中获得了人类评估者偏好的摘要质量,接近人类参考性能。
  • 优化版本生成步骤成功整合了反馈,尤其在从多个候选版本中选择相似度最高的版本时表现更优。
  • 该方法优于基线模型输出和无反馈的优化版本,定性分析显示,基于反馈的优化版本包含了初始摘要中遗漏的关键细节。
  • 分析证实,基于嵌入的相似度能有效识别与反馈对齐的优化版本,验证了选择策略的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。