[论文解读] Stable Policy Optimization via Off-Policy Divergence Regularization
该论文提出 PPO-DICE,一种通过使用离策略、对抗性训练最小化连续策略之间状态-动作访问频次分布差异来正则化策略更新的稳定策略优化方法。与 PPO 和 TRPO 相比,该方法通过直接约束长期分布偏移而非依赖动作概率裁剪,在 Atari 和 MuJoCo 基准测试中提升了样本效率和最终性能。
Trust Region Policy Optimization (TRPO) and Proximal Policy Optimization (PPO) are among the most successful policy gradient approaches in deep reinforcement learning (RL). While these methods achieve state-of-the-art performance across a wide range of challenging tasks, there is room for improvement in the stabilization of the policy learning and how the off-policy data are used. In this paper we revisit the theoretical foundations of these algorithms and propose a new algorithm which stabilizes the policy improvement through a proximity term that constrains the discounted state-action visitation distribution induced by consecutive policies to be close to one another. This proximity term, expressed in terms of the divergence between the visitation distributions, is learned in an off-policy and adversarial manner. We empirically show that our proposed method can have a beneficial effect on stability and improve final performance in benchmark high-dimensional control tasks.
研究动机与目标
- 解决 PPO 和 TRPO 等策略梯度方法中策略更新不稳定性及离策略数据再利用不足的问题。
- 通过直接约束连续策略之间长期状态-动作访问频次分布的偏移,提升策略优化的稳定性。
- 开发一种利用离策略、对抗性训练来估计并正则化访问频次分布差异的方法。
- 通过实证验证,直接访问频次分布正则化可带来更好的最终性能和样本效率。
- 证明动作概率裁剪不足以控制长期分布偏移,而访问频次分布控制更为有效。
提出的方法
- 提出一种基于连续策略所诱导的状态-动作访问频次分布之间差异的新正则化项。
- 使用离策略、对抗性训练,通过判别器网络估计访问频次分布之间的差异。
- 将差异正则化整合进 PPO 的代理目标中,形成一种惩罚大分布偏移的新目标函数。
- 采用双重优化机制:策略通过最大化正则化目标进行更新,而判别器则被训练以准确估计访问频次分布差异。
- 使用超参数 λ 平衡策略目标与差异正则化,并在训练过程中自适应调整。
- 对动作损失应用裁剪作为额外正则化项,与 PPO 保持一致,以进一步稳定训练。
实验结果
研究问题
- RQ1直接正则化状态-动作访问频次分布差异是否能提升策略优化的稳定性和最终性能?
- RQ2在深度强化学习中,离策略、对抗性估计访问频次分布差异是否有效且可扩展?
- RQ3通过访问频次分布差异控制长期分布偏移,是否能带来比动作概率裁剪更好的样本效率和性能?
- RQ4在多样化高维控制环境中,该方法与 PPO 和 TRPO 相比表现如何?
- RQ5在实践中,哪些超参数设置(如判别器训练步数、学习率)能实现最佳性能?
主要发现
- 在 17 个 Atari 环境中的 12 个上,PPO-DICE 显著优于 PPO,最终平均奖励具有统计学显著性提升。
- 在 MuJoCo 套件中,PPO-DICE 在所测试的 6 个最具挑战性的环境中,有 5 个达到了高于 PPO 和 TRPO 的最终性能。
- 采用裁剪动作损失和自适应 λ 调度的模型表现出更优的稳定性,避免了未裁剪变体中出现的性能崩溃。
- 在每个策略更新中使用 K=5 步判别器优化,且判别器学习率设置为策略学习率的 10 倍,可在各类环境中实现最佳整体性能。
- 实证结果表明,访问频次分布差异正则化可带来更稳定的训练和更优的泛化能力,优于仅依赖动作概率约束的方法。
- 消融实验确认,即使使用访问频次分布正则化,对动作损失进行裁剪对于防止方差引起的策略退化也至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。