Skip to main content
QUICK REVIEW

[论文解读] Offline RL for Natural Language Generation with Implicit Language Q Learning

Charlie Snell, Ilya Kostrikov|arXiv (Cornell University)|Jun 5, 2022
Topic Modeling被引用 9
一句话总结

本文提出了一种名为隐式语言Q值强化学习(ILQL)的新方法,这是一种用于在仅使用静态、次优数据集的情况下,通过离线强化学习微调大型语言模型以优化用户指定奖励函数的新型离线强化学习方法。ILQL结合了价值保守性与隐式数据集支持约束,以稳定训练过程并实现无需在线交互的有效策略学习,在客观与主观奖励函数上均表现出色,包括毒性内容检测与对话生成任务。

ABSTRACT

Large language models distill broad knowledge from text corpora. However, they can be inconsistent when it comes to completing user specified tasks. This issue can be addressed by finetuning such models via supervised learning on curated datasets, or via reinforcement learning. In this work, we propose a novel offline RL method, implicit language Q-learning (ILQL), designed for use on language models, that combines both the flexible utility maximization framework of RL algorithms with the ability of supervised learning to leverage previously collected data, as well as its simplicity and stability. Our method employs a combination of value conservatism alongside an implicit dataset support constraint in learning value functions, which are then used to guide language model generations towards maximizing user-specified utility functions. In addition to empirically validating ILQL, we present a detailed empirical analysis of situations where offline RL can be useful in natural language generation settings, demonstrating how it can be a more effective utility optimizer than prior approaches for end-to-end dialogue, and how it can effectively optimize high variance reward functions based on subjective judgement, such as whether to label a comment as toxic or not.

研究动机与目标

  • 解决大型语言模型与用户指定任务对齐的挑战,这些任务在提示时往往不一致。
  • 通过在静态数据集上实现稳定且数据高效的策略优化,克服监督微调与在线强化学习的局限性。
  • 设计一种支持时间组合性的方法——即使数据集中仅包含平庸或次优示例,也能学习到最优行为。
  • 实现对高方差或主观性奖励函数(如毒性分类)的有效优化,这类任务对标准监督或模仿方法而言具有挑战性。
  • 在训练简洁性、可扩展性与性能之间取得平衡,使离线强化学习在真实自然语言处理应用中更具可行性。

提出的方法

  • 使用带有标注奖励的离线数据,训练基于Transformer的语言模型以预测状态-动作Q值和状态值。
  • 通过拟合Q函数的上期望分位数来实现迭代策略改进,从而实现对高性能策略的稳定优化。
  • 通过施加隐式数据集支持约束,确保策略输出保持在示范数据的支持范围内,提升泛化能力与稳定性。
  • 通过学习可在推理阶段用于通过似然扰动引导标准语言模型的值函数,实现训练与推理的解耦。
  • 使用温度参数(τ)和β参数控制探索与策略熵,实现性能与多样性之间的权衡。
  • 在训练过程中避免依赖反事实采样或外部语言模型似然,降低训练时间复杂度与依赖性。

实验结果

研究问题

  • RQ1离线强化学习方法是否能仅使用静态、次优数据集,在无需在线交互的情况下有效优化语言模型行为?
  • RQ2在多种奖励函数上,ILQL相较于监督微调与先前的离线强化学习基线方法,在性能与稳定性方面表现如何?
  • RQ3当数据集中仅包含平庸或非最优示例时,ILQL是否仍能学习到最优行为,从而体现时间组合性?
  • RQ4ILQL是否能有效优化主观性或高方差的奖励函数,如毒性检测或人类偏好对齐?
  • RQ5ILQL在提升性能的同时,能在多大程度上保持策略多样性?超参数β与τ如何影响这一权衡?

主要发现

  • 在毒性评论生成任务中,ILQL优于监督微调与过滤微调,平均奖励达到-0.01 ± 0.01(β=16)与0.00 ± 0.00(β=32),且熵接近零,表明输出质量高且无毒性。
  • 在Reddit评论数据集上,ILQL在τ=0.6与β=32时,获得9.83 ± 0.04(真实)与10.00 ± 0.00(模型)的点赞数,显著优于单步强化学习与微调基线方法。
  • 在人类Wordle数据集中,ILQL在τ=0.7与β=4时获得-2.23 ± 0.03的奖励,优于单步强化学习(-2.24 ± 0.03)与过滤微调(-2.93 ± 0.06)。
  • ILQL在多种奖励函数上均保持高性能,包括客观奖励(如对话成功)与主观奖励(如毒性),展现出强大的鲁棒性。
  • 随着β增大,ILQL策略的性能提升但熵降低,表明在奖励最大化与输出多样性之间实现了有效权衡。
  • ILQL在端到端对话与主观奖励优化任务中达到最先进性能,同时避免了先前离线强化学习方法的高复杂度与不稳定性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。