Skip to main content
QUICK REVIEW

[论文解读] Text Generation by Learning from Demonstrations

Richard Yuanzhe Pang, He He|arXiv (Cornell University)|Sep 16, 2020
Topic Modeling参考文献 60被引用 5
一句话总结

本文提出GOLD(基于示范的离策略学习生成),一种离策略强化学习方法,通过使用重要性加权从参考(示范)序列中学习,以提升文本生成质量。通过使用基于质量的奖励将训练对齐于人类评估,GOLD减少了暴露偏差,在摘要生成、问题生成和机器翻译任务中,其自动指标和人类评估结果均优于最大似然估计(MLE)和策略梯度方法。

ABSTRACT

Current approaches to text generation largely rely on autoregressive models and maximum likelihood estimation. This paradigm leads to (i) diverse but low-quality samples due to mismatched learning objective and evaluation metric (likelihood vs. quality) and (ii) exposure bias due to mismatched history distributions (gold vs. model-generated). To alleviate these problems, we frame text generation as an offline reinforcement learning (RL) problem with expert demonstrations (i.e., the reference), where the goal is to maximize quality given model-generated histories. We propose GOLD (generation by off-policy learning from demonstrations): an easy-to-optimize algorithm that learns from the demonstrations by importance weighting. Intuitively, GOLD upweights confident tokens and downweights unconfident ones in the reference during training, avoiding optimization issues faced by prior RL approaches that rely on online data collection. According to both automatic and human evaluation, models trained by GOLD outperform those trained by MLE and policy gradient on summarization, question generation, and machine translation. Further, our models are less sensitive to decoding algorithms and alleviate exposure bias.

研究动机与目标

  • 解决文本生成中训练目标(最大似然)与评估指标(人类评分质量)之间的不一致问题。
  • 缓解因在黄金前缀上进行训练但推理时使用模型生成的前缀所导致的暴露偏差。
  • 通过无需在线交互地从专家示范中学习,提升生成质量。
  • 开发一种稳定、离策略的强化学习方法,避免先前基于强化学习的文本生成方法中的优化问题。
  • 构建对解码策略具有鲁棒性、且对长度相关退化不敏感的模型。

提出的方法

  • 将文本生成建模为使用参考序列作为专家示范的离策略强化学习问题。
  • 应用离策略策略梯度方法,并结合重要性加权,根据模型置信度重新加权训练样本。
  • 使用近似人类判断序列质量的奖励函数,估算人类生成每个标记的可能性。
  • 训练生成器以最大化由模型生成历史所诱导轨迹的期望奖励。
  • 采用重要性加权方法,提升高置信度标记的权重,降低低置信度标记的权重。
  • 将该方法集成到基于Transformer的模型中,实现摘要生成、问题生成和翻译任务的端到端训练。

实验结果

研究问题

  • RQ1从专家示范中进行离策略强化学习是否能将文本生成质量提升至超过最大似然估计的水平?
  • RQ2所提出的方法是否能减少暴露偏差,并提升对解码策略的鲁棒性?
  • RQ3在离策略强化学习中,重要性加权是否能稳定训练并提升性能,相比在线策略梯度方法?
  • RQ4该方法在多样化的文本生成任务中,对人类评分质量和自动指标的提升程度如何?
  • RQ5模型在更长的生成长度下是否仍能保持高质量,避免因错误累积导致的性能下降?

主要发现

  • 在摘要生成、问题生成和机器翻译任务中,GOLD在自动指标(BLEU、ROUGE)和人类评估中均优于MLE和策略梯度微调方法。
  • 在人类成对比较中,44.3%的GOLD生成问题被评为优于MLE生成的问题,而MLE仅占23.0%,32.8%的样本为并列。
  • 人类评估显示,GOLD生成的摘要在语义保真度方面更接近参考摘要,优于MLE生成的摘要。
  • GOLD模型对解码算法的敏感性降低,表明其鲁棒性得到提升。
  • 该方法缓解了暴露偏差,在生成长度增加时仍能保持一致的输出质量。
  • 重要性加权有效稳定了训练过程,并通过聚焦于高置信度参考标记提升了样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。