Skip to main content
QUICK REVIEW

[论文解读] Fine-Tuning Language Models with Advantage-Induced Policy Alignment

Banghua Zhu, Hiteshi Sharma|arXiv (Cornell University)|Jun 4, 2023
Topic Modeling被引用 5
一句话总结

本文提出优势诱导策略对齐(APA),一种新颖的强化学习算法,用于通过人类反馈微调语言模型。通过最小化策略与基于估计优势推导出的目标策略之间的平方误差损失,APA在样本效率、训练稳定性以及超参数敏感度方面优于PPO和AWR,持续在HH和StackExchange数据集上表现更优,同时对策略差异实现了更紧密的控制。

ABSTRACT

Reinforcement learning from human feedback (RLHF) has emerged as a reliable approach to aligning large language models (LLMs) to human preferences. Among the plethora of RLHF techniques, proximal policy optimization (PPO) is of the most widely used methods. Despite its popularity, however, PPO may suffer from mode collapse, instability, and poor sample efficiency. We show that these issues can be alleviated by a novel algorithm that we refer to as Advantage-Induced Policy Alignment (APA), which leverages a squared error loss function based on the estimated advantages. We demonstrate empirically that APA consistently outperforms PPO in language tasks by a large margin, when a separate reward model is employed as the evaluator. In addition, compared with PPO, APA offers a more stable form of control over the deviation from the model's initial policy, ensuring that the model improves its performance without collapsing to deterministic output. In addition to empirical results, we also provide a theoretical justification supporting the design of our loss function.

研究动机与目标

  • 解决基于PPO的从人类反馈中强化学习(RLHF)中存在的不稳定性、样本效率低下以及超参数敏感度高的问题。
  • 为对齐语言模型与人类偏好,开发一种比PPO和优势加权回归(AWR)更稳定、更高效的替代方法。
  • 为基于优势估计的新损失函数提供理论依据,该方法避免了重要性比估计。
  • 在标准基准上通过奖励模型得分和GPT-4偏好标注,实证验证该方法的有效性。

提出的方法

  • APA使用平方误差损失,直接将语言模型的策略与由初始策略和基于估计优势的修正项组成的目标准策略对齐。
  • 目标策略通过初始策略和从在线rollouts中估计的优势函数构建,实现无需重要性比估计的直接策略优化。
  • 该方法通过使用仅依赖当前策略和估计优势的群体损失,避免了PPO的裁剪机制和AWR的乘法重加权。
  • 算法引入单一超参数λ以控制与初始策略的KL散度,相比PPO所需的多个裁剪范围和系数参数,显著简化了超参数调优。
  • 损失函数被设计为在固定优势估计下可证明收敛至最优策略,为其设计提供了理论基础。
  • 训练在在线设置下进行,优化过程中持续生成新的rollouts,实现持续反馈与适应。

实验结果

研究问题

  • RQ1与PPO和AWR相比,基于优势估计的损失函数是否能提升语言模型RLHF中的样本效率和训练稳定性?
  • RQ2在策略更新中避免重要性比估计是否能带来更稳定、更可靠的策略优化?
  • RQ3APA的单超参数KL控制与PPO的多超参数KL控制器相比,在性能和鲁棒性方面表现如何?
  • RQ4与PPO相比,APA在较小模型中在多大程度上保持了策略多样性并避免了模式崩溃?
  • RQ5在离线强化学习设置下,当数据集固定且可能出现分布偏移时,APA的表现如何?

主要发现

  • 在相同样本数量下,APA在HH和StackExchange数据集上的奖励得分显著高于PPO和AWR,证明了其优越的样本效率。
  • APA的训练轨迹更加稳定,避免了PPO在策略差异超过安全阈值时出现的突然性能下降。
  • APA中最终策略与初始策略之间的KL散度始终更低且更具可预测性,表明对策略偏差的控制更优。
  • APA仅需一个主要超参数(用于KL控制的λ),而PPO需要仔细调优多个参数,包括裁剪范围和KL系数,因此APA更易于校准。
  • 在离线设置下,APA因分布偏移导致性能下降,而AWR保持更强鲁棒性,表明APA在离线强化学习场景中存在关键局限性。
  • 使用GPT-4标注人类偏好的实证结果表明,经APA微调的模型生成的回复比PPO微调的模型更受偏好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。