[论文解读] Boosting the Actor with Dual Critic
该论文提出了一种新型的演员-评论家强化学习算法——双演员-评论家(Dual-AC),将策略优化建模为演员与源自贝尔曼最优性方程拉格朗日对偶形式的双评论家之间的双人博弈。通过联合优化两个组件以实现相同的目标,结合多步bootstrapping、路径正则化和随机对偶上升法,Dual-AC在MuJoCo连续控制基准测试中实现了最先进性能,显著优于PPO和TRPO,在样本效率和最终性能方面均表现更优。
This paper proposes a new actor-critic-style algorithm called Dual Actor-Critic or Dual-AC. It is derived in a principled way from the Lagrangian dual form of the Bellman optimality equation, which can be viewed as a two-player game between the actor and a critic-like function, which is named as dual critic. Compared to its actor-critic relatives, Dual-AC has the desired property that the actor and dual critic are updated cooperatively to optimize the same objective function, providing a more transparent way for learning the critic that is directly related to the objective function of the actor. We then provide a concrete algorithm that can effectively solve the minimax optimization problem, using techniques of multi-step bootstrapping, path regularization, and stochastic dual ascent algorithm. We demonstrate that the proposed algorithm achieves the state-of-the-art performances across several benchmarks.
研究动机与目标
- 为解决标准演员-评论家方法中存在不稳定性和样本效率低下的问题,重新思考评论家的作用。
- 构建一个原则性框架,使演员与评论家共同优化同一目标函数。
- 通过利用贝尔曼方程的对偶形式,提升连续控制任务中的学习稳定性和性能。
- 通过路径正则化和多步bootstrapping,识别并解决基于双优化的强化学习算法中的关键不稳定性来源。
- 在具有挑战性的MuJoCo运动控制任务中实现最先进性能。
提出的方法
- 该算法源自贝尔曼最优性方程的拉格朗日对偶形式,将策略学习建模为演员与双评论家之间的双人博弈。
- 双评论家被训练以近似最优值函数,而非当前策略下的值函数,从而实现更直接的策略改进。
- 采用随机对偶上升算法求解极小-极大优化问题,确保朝共享目标进行协作式更新。
- 引入多步bootstrapping以改善值函数估计中的偏差-方差权衡。
- 应用路径正则化以通过增强非凸-凹设置下的数值稳定性来稳定训练。
- 完整算法将这些组件整合为一个稳定且样本高效的连续控制训练流程。
实验结果
研究问题
- RQ1若双评论家近似最优值函数而非当前策略的值函数,是否能带来更稳定和高效的策略学习?
- RQ2在联合演员-双评论家优化中,主要的不稳定性来源是什么?如何加以缓解?
- RQ3多步bootstrapping如何影响基于双优化的强化学习中的偏差-方差权衡?
- RQ4路径正则化能否在非凸-凹设置下恢复局部对偶性并提升训练稳定性?
- RQ5所提出的Dual-AC算法是否在多种连续控制任务中均优于SOTA基线方法(如PPO和TRPO)?
主要发现
- Dual-AC在六种MuJoCo环境中的五种上取得了最高最终性能,包括InvertedDoublePendulum-v1、Hopper-v1、HalfCheetah-v1和Walker-v1。
- 在InvertedDoublePendulum-v1上,Dual-AC的最终回报达到8599.47,显著优于PPO(1776.26)和TRPO(3070.96)。
- 在Hopper-v1上,Dual-AC的最终回报为2983.79,高于PPO的2376.15和TRPO的2483.57。
- 在HalfCheetah-v1上,Dual-AC获得3041.47的回报,显著超过PPO(2249.10)和TRPO(2347.19)。
- 在Walker-v1上,Dual-AC达到4103.60的回报,优于PPO(3315.45)和TRPO(2838.99)。
- 消融研究证实,路径正则化和多步bootstrapping对收敛性和性能至关重要,而朴素的Dual-AC则无法收敛。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。