Skip to main content
QUICK REVIEW

[论文解读] Learning New Skills after Deployment: Improving open-domain internet-driven dialogue with human feedback

Jing Xu, Megan Ung|arXiv (Cornell University)|Aug 5, 2022
Topic Modeling被引用 6
一句话总结

本文提出了一种用于开放域对话智能体的持续学习框架,通过在实际人类交互过程中收集的多样化人类反馈(如模块化错误标注、二元评分和自由格式建议)来提升部署后的性能。使用模块化和二元反馈微调的Director模型取得了当前最优结果,迭代微调进一步提升了性能,且小模型收集的反馈也能有效改善大规模模型(如OPT-175B)的性能。

ABSTRACT

Frozen models trained to mimic static datasets can never improve their performance. Models that can employ internet-retrieval for up-to-date information and obtain feedback from humans during deployment provide the promise of both adapting to new information, and improving their performance. In this work we study how to improve internet-driven conversational skills in such a learning framework. We collect deployment data, which we make publicly available, of human interactions, and collect various types of human feedback -- including binary quality measurements, free-form text feedback, and fine-grained reasons for failure. We then study various algorithms for improving from such feedback, including standard supervised learning, rejection sampling, model-guiding and reward-based learning, in order to make recommendations on which type of feedback and algorithms work best. We find the recently introduced Director model (Arora et al., '22) shows significant improvements over other existing approaches.

研究动机与目标

  • 探究对话智能体是否能通过在部署期间收集反馈,在标准预训练和微调后学习新技能。
  • 评估不同反馈类型(模块化、二元、自由格式及故障类型标注)在提升模型性能方面的有效性。
  • 对比监督学习、拒绝采样、模型引导和基于奖励的学习等学习算法在反馈整合中的表现。
  • 评估从较小模型(3B参数)收集的反馈是否能有效提升更大规模模型(175B参数)的性能。
  • 探索迭代式、持续学习循环,即模型在前序部署轮次的反馈基础上进行再训练。

提出的方法

  • 在Amazon Mechanical Turk上部署了一个3B参数的对话智能体,以收集众包工作者的人机交互及反馈。
  • 收集了三种类型的反馈:二元反馈(好/坏)、自由格式文本反馈,以及识别故障类型(搜索、结果或响应相关)的模块化反馈。
  • 训练并对比了多种学习方法:监督微调、拒绝采样、模型引导和基于奖励的学习。
  • 采用近期提出的Director模型(Arora et al., 2022)进行二元反馈学习,其表现优于其他方法。
  • 实施了迭代部署:在前序轮次的反馈基础上对模型进行再训练(v1 → v2),实现持续改进。
  • 使用从小型3B模型收集的反馈对一个175B参数的模型(BlenderBot 3)进行微调,证明了反馈的可迁移性。

实验结果

研究问题

  • RQ1对话智能体能否通过真实人类交互中的反馈,在部署后学习新的对话技能?
  • RQ2在模块化、二元和自由格式反馈中,哪种类型的人类反馈对提升对话性能最有效?
  • RQ3不同学习算法(如Director、基于奖励的学习、监督微调)在利用反馈提升对话性能方面如何比较?
  • RQ4在前序部署轮次的反馈基础上进行迭代式、持续性再训练是否能带来可测量的性能提升?
  • RQ5从较小模型(3B参数)收集的反馈是否能有效提升更大规模模型(175B参数)的性能?
  • RQ6反馈粒度(如故障类型分类)对模型性能有何影响?

主要发现

  • 模块化反馈——特别是识别故障类型(如搜索、结果或响应相关错误)——显著优于仅基于最终响应的反馈。
  • 使用二元反馈微调的Director模型在性能上优于重排序或基于奖励的学习方法。
  • 结合模块化与二元反馈并使用Director模型,可在自动评估和人工评估中均取得最佳整体结果。
  • 在前序部署轮次反馈基础上进行迭代再训练(v1 → v2)带来了显著的性能提升,证明了持续学习的价值。
  • 从小型3B参数模型收集的反馈有效提升了175B参数模型(BlenderBot 3)的性能,实现了64.8%的回复率和4.08的平均人工评分。
  • 尽管性能显著提升,即使是最优模型(如BB3-175B)仍会产生事实性错误和矛盾,表明通过持续反馈收集仍有进一步改进空间。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。