[论文解读] How to Learn a Useful Critic? Model-based Action-Gradient-Estimator Policy Optimization
该论文提出 MAGE,一种基于模型的演员-评论家强化学习算法,通过使用学习到的动力学模型进行时序差分学习,显式训练评论家以预测准确的动作价值梯度。通过利用动力学模型的二阶微分,MAGE 在 MuJoCo 连续控制基准测试中比当前最先进(SOTA)的无模型和基于模型的基线方法实现了更高效的样本利用。
Deterministic-policy actor-critic algorithms for continuous control improve the actor by plugging its actions into the critic and ascending the action-value gradient, which is obtained by chaining the actor's Jacobian matrix with the gradient of the critic with respect to input actions. However, instead of gradients, the critic is, typically, only trained to accurately predict expected returns, which, on their own, are useless for policy optimization. In this paper, we propose MAGE, a model-based actor-critic algorithm, grounded in the theory of policy gradients, which explicitly learns the action-value gradient. MAGE backpropagates through the learned dynamics to compute gradient targets in temporal difference learning, leading to a critic tailored for policy improvement. On a set of MuJoCo continuous-control tasks, we demonstrate the efficiency of the algorithm in comparison to model-free and model-based state-of-the-art baselines.
研究动机与目标
- 为解决传统评论家仅优化价值预测而非动作梯度准确性的局限性,而后者对确定性策略梯度方法至关重要。
- 通过训练评论家提供精确的梯度以实现策略改进,从而提升连续控制任务中的样本效率。
- 开发一种基于模型的方法,直接针对策略优化中使用的梯度信号来优化评论家,而非仅针对回报预测。
- 证明显式学习动作梯度可带来更优的策略性能和更快的收敛速度,尤其在高维控制任务中。
提出的方法
- MAGE 使用学习到的动力学模型生成合成转移样本,使网络可通过模型反向传播以计算评论家的目标梯度。
- 评论家通过时序差分学习进行训练,以最小化预测动作价值梯度与目标梯度之间的误差,使用双重反向传播计算梯度目标。
- 动作梯度目标通过对方差模型的可微性,对时序差分目标关于动作进行微分得到。
- 该方法将演员的雅可比矩阵与评论家的动作梯度相结合,以计算策略梯度,确保评论家训练与策略改进的一致性。
- 采用动力学模型的集成以提升梯度目标的鲁棒性和泛化能力。
- 评论家的损失函数结合了价值预测误差和梯度预测误差,梯度监督来自模型的可微动力学。
实验结果
研究问题
- RQ1能否显式训练评论家以预测准确的动作价值梯度,而非仅预测期望回报,从而实现更优的策略优化?
- RQ2使用学习到的动力学模型生成梯度目标是否能提升基于模型强化学习中的样本效率?
- RQ3与标准价值预测训练相比,显式动作梯度学习在策略性能和收敛速度方面表现如何?
- RQ4通过动力学模型进行二阶微分是否能产生比标准无模型或基于模型方法更有效的策略梯度?
主要发现
- 在 MuJoCo 连续控制环境中,MAGE 的样本效率显著优于当前最先进(SOTA)的无模型和基于模型基线方法。
- 由于评论家对动作梯度的准确估计,该算法收敛更快且最终性能更高。
- 显式训练评论家以预测动作梯度,相比仅基于价值的训练,能带来更稳定和高效的策略更新。
- 通过双重反向传播使用基于模型的梯度目标,即使在动力学模型近似的情况下,也能实现更优的策略优化。
- 尽管由于二阶梯度导致训练时间翻倍,但 MAGE 的样本效率使其在交互成本较高的环境中更具适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。