[论文解读] Revisiting Design Choices in Proximal Policy Optimization
本文重新审视了近端策略优化(PPO)中的核心设计选择,识别出在使用裁剪目标函数和高斯/Softmax策略的标准实现中存在三种失效模式。本文提出采用Beta分布参数化连续动作,并采用KL正则化目标函数以提升鲁棒性,实验表明在Humanoid-v2环境中累积奖励提升2倍,且在分布外设置下收敛性更优。
Proximal Policy Optimization (PPO) is a popular deep policy gradient algorithm. In standard implementations, PPO regularizes policy updates with clipped probability ratios, and parameterizes policies with either continuous Gaussian distributions or discrete Softmax distributions. These design choices are widely accepted, and motivated by empirical performance comparisons on MuJoCo and Atari benchmarks. We revisit these practices outside the regime of current benchmarks, and expose three failure modes of standard PPO. We explain why standard design choices are problematic in these cases, and show that alternative choices of surrogate objectives and policy parameterizations can prevent the failure modes. We hope that our work serves as a reminder that many algorithmic design choices in reinforcement learning are tied to specific simulation environments. We should not implicitly accept these choices as a standard part of a more general algorithm.
研究动机与目标
- 探究为何广泛采用的PPO设计选择——裁剪代理目标函数与高斯/Softmax策略参数化——在分布外环境中失效。
- 诊断在连续与离散动作空间中未被标准MuJoCo与Atari基准测试揭示的具体失效模式。
- 评估替代设计选择(包括KL正则化目标函数与Beta策略参数化)在提升收敛性与鲁棒性方面的效果。
- 挑战当前PPO实现代表通用解决方案的假设,倡导在强化学习中采用上下文感知的算法设计。
提出的方法
- 设计合成测试环境以隔离PPO中的失效模式:在动作空间边界外奖励消失、在局部最优附近对初始化敏感,以及在稀疏奖励离散设置中收敛次优。
- 将标准裁剪代理目标函数替换为KL正则化目标函数,以更严谨地施加信任区域约束,从而在特定设置下获得理论收敛保证。
- 在连续动作空间中采用Beta分布进行策略参数化,利用其有界支持以及通过α=β=1实现均匀初始化的能力。
- 对Beta分布参数(α, β)采用softplus参数化,以支持基于梯度的优化并实现稳定训练。
- 在合成任务与标准MuJoCo基准测试上,对比PPO使用Beta策略与KL正则化目标函数与标准PPO(裁剪、高斯)的性能表现。
- 分析优势函数归一化与奖励缩放等附加实现选择的影响,表明恒定缩放可替代复杂方案而无需性能损失。
实验结果
研究问题
- RQ1为何在奖励于动作空间边界外消失时,使用裁剪目标函数与高斯策略的标准PPO在连续动作空间中会失效?
- RQ2在具有稀疏高奖励峰的离散动作空间中,策略初始化如何影响收敛性?这种影响能否通过替代参数化方式缓解?
- RQ3KL正则化代理目标函数在收敛稳定性与分布外鲁棒性方面是否优于裁剪目标函数?
- RQ4Beta策略参数化能否消除连续控制任务中与尾部梯度和边界效应相关的失效模式?
- RQ5常见实现选择(如优势函数归一化与奖励缩放)在多样化环境中在多大程度上影响PPO性能?
主要发现
- 当奖励在动作空间边界外消失时,使用裁剪目标函数与高斯策略的标准PPO在连续控制任务中无法收敛,原因在于尾部动作引发的大梯度更新。
- 采用Beta策略参数化的PPO在MuJoCo的Humanoid-v2环境中实现的累积回报是高斯策略的2倍,展现出显著的性能提升。
- KL正则化PPO在其中一个合成失效模式设置中提供了收敛保证,而裁剪目标函数则不能,表明其具有根本性的鲁棒性优势。
- Beta策略可通过α=β=1实现近似均匀初始化,从而消除在多峰奖励景观中因初始化不佳导致的次优收敛问题。
- 裁剪方法相对于KL正则化的优势仅存在于使用高斯策略的MuJoCo基准特定场景中;在Beta策略上,KL正则化PPO在大多数任务中表现相当或更优。
- 恒定奖励缩放与复杂自适应方案性能相当,优势函数归一化在某些任务中可能有帮助,但在其他任务中可能产生负面影响,实质上等效于调节镜面下降的步长。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。