[论文解读] Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment
本文提出成对近端策略优化(P3O),一种基于轨迹的强化学习算法,直接基于人类偏好标签的比较奖励进行优化,无需价值函数近似和奖励缩放。P3O在KL-奖励权衡和人类偏好对齐方面优于PPO和DPO,在代理奖励和GPT-4胜率方面均表现更优。
Large Language Models (LLMs) can acquire extensive world knowledge through pre-training on large corpora. However, due to exposure to low-quality data, LLMs may exhibit harmful behavior without aligning with human values. The dominant approach for steering LLMs towards beneficial behavior involves Reinforcement Learning with Human Feedback (RLHF), with Proximal Policy Optimization (PPO) serving as the default RL optimizer. Despite its effectiveness, PPO has limitations when optimizing rewards trained from comparison-based loss. Primarily, PPO is not invariant to equivalent reward functions containing identical preference information due to the need to calibrate the reward scale. Additionally, PPO's necessity for token-wise updates introduces complexity in both function approximation and algorithm design compared to trajectory-wise optimization. This paper proposes a new framework, reinforcement learning with relative feedback, and a novel trajectory-wise policy gradient algorithm, Pairwise Proximal Policy Optimization (P3O) that operates directly on comparative rewards. We show theoretically that P3O is invariant to equivalent rewards and avoids the complexity of PPO. Empirical evaluations demonstrate that P3O outperforms PPO in the KL-Reward trade-off and can align with human preferences as well as or better than prior methods. In summary, this work introduces a simpler yet effective approach for aligning LLMs to human preferences through relative feedback.
研究动机与目标
- 为解决PPO在使用Bradley-Terry等比较损失训练奖励模型时的不稳定性和奖励尺度敏感性问题。
- 开发一种原生基于人类偏好比较的相对反馈进行操作的强化学习框架,避免对绝对奖励缩放的需求。
- 设计一种更简单的、基于轨迹的策略梯度算法,避免使用复杂组件如价值函数估计和广义优势估计(GAE)。
- 在保持与人类偏好强对齐的同时,改善大语言模型对齐中的KL-奖励权衡。
- 在偏好保持变换下实现对等奖励函数的不变性,确保优化结果的一致性。
提出的方法
- 提出一种新框架——基于相对反馈的强化学习,其中策略仅使用响应对之间的成对奖励差异进行更新。
- 引入成对近端策略优化(P3O),一种基于轨迹的策略梯度算法,直接在比较奖励上进行优化,无需价值函数$V$或优势估计。
- 采用近端策略更新机制,在仅使用相对反馈的同时保持策略稳定性,并确保对奖励函数常数偏移的不变性。
- 使用联合裁剪策略(P3O-V2)以平衡策略更新幅度并改善KL控制,其性能优于独立裁剪(P3O-V1)。
- 将策略梯度更新适配为可直接与通过Bradley-Terry损失训练的代理奖励模型配合使用,后者对常数奖励偏移具有不变性。
- 引入online-DPO作为基线进行比较,表明即使online-DPO也未完全对等奖励保持不变,而P3O则实现了这一点。
实验结果
研究问题
- RQ1能否设计一种基于轨迹的策略梯度算法,使其对源自同一偏好数据的等价奖励函数保持不变?
- RQ2消除价值函数近似和奖励缩放是否能提升大语言模型对齐中的训练稳定性和对齐性能?
- RQ3P3O在KL-奖励权衡和人类偏好对齐方面与PPO和DPO相比如何?
- RQ4基于成对相对反馈的强化学习算法是否能优于基于标记级绝对反馈的PPO等方法?
- RQ5代理奖励胜率与人类偏好评估(如GPT-4)之间是否存在显著性能差距,P3O能否弥合这一差距?
主要发现
- P3O-V2在保持显著更低的KL散度的同时,获得了高于PPO和DPO的奖励,在TL;DR和HH数据集上均展现出更优的KL-奖励权衡。
- P3O在与PPO的对比中取得57.0%的GPT-4胜率,在与SFT的对比中取得69.3%的胜率,优于DPO(尽管DPO奖励更高,但其GPT-4胜率仅为45.4%)。
- DPO获得的代理奖励高于P3O,但其KL散度高出25%,表明奖励与策略一致性之间存在权衡。
- P3O-V1的奖励略高于P3O-V2,但KL效率更差,因此选择P3O-V2作为主要比较基线。
- KL-奖励前沿图显示,P3O-V2在HH数据集上对两种模型尺寸均全面优于PPO和DPO,在最优范围内始终高出0.1–0.3的奖励。
- 实证结果证实,P3O对等价奖励函数具有不变性,而PPO则不具备,验证了奖励函数不变性的理论主张。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。