Skip to main content
QUICK REVIEW

[论文解读] Soft Policy Gradient Method for Maximum Entropy Deep Reinforcement Learning

Wenjie Shi, Shiji Song|arXiv (Cornell University)|Sep 7, 2019
Reinforcement Learning in Robotics参考文献 24被引用 4
一句话总结

本文提出 Deep Soft Policy Gradient (DSPG),一种无模型、离策略的最大熵深度强化学习算法,结合软策略梯度与基于双采样的软贝尔曼方程,实现在连续控制任务中稳定且高性能的学习。在 Ant、HalfCheetah、Hopper 和 Walker2d 等基准环境上,DSPG 在样本效率、最终性能和训练稳定性方面均优于 DDPG 和 SAC。

ABSTRACT

Maximum entropy deep reinforcement learning (RL) methods have been demonstrated on a range of challenging continuous tasks. However, existing methods either suffer from severe instability when training on large off-policy data or cannot scale to tasks with very high state and action dimensionality such as 3D humanoid locomotion. Besides, the optimality of desired Boltzmann policy set for non-optimal soft value function is not persuasive enough. In this paper, we first derive soft policy gradient based on entropy regularized expected reward objective for RL with continuous actions. Then, we present an off-policy actor-critic, model-free maximum entropy deep RL algorithm called deep soft policy gradient (DSPG) by combining soft policy gradient with soft Bellman equation. To ensure stable learning while eliminating the need of two separate critics for soft value functions, we leverage double sampling approach to making the soft Bellman equation tractable. The experimental results demonstrate that our method outperforms in performance over off-policy prior methods.

研究动机与目标

  • 解决如 DDPG 等on-policy 方法在高维连续控制任务中存在不稳定性和样本效率低下的问题。
  • 克服离策略值函数方法在连续动作空间中需要复杂采样过程的局限性。
  • 在最大熵框架下,开发一种稳定、可扩展且样本高效的深度强化学习算法,以提升探索能力和鲁棒性。
  • 通过使用单个评论家结合双采样技术,消除软 Q 学习中对两个独立评论家的需求,降低近似误差并提高训练稳定性。
  • 在具有挑战性的连续控制基准测试中,相比先前的离策略方法(如 DDPG 和 SAC),实现更优的性能与稳定性。

提出的方法

  • 从带熵正则化的期望奖励目标推导软策略梯度,以优化连续动作空间中的随机策略。
  • 构建一个基于两个深度神经网络的离策略演员-评论家框架:一个用于随机策略(演员),一个用于软 Q 函数(评论家)。
  • 引入双采样方法,使软贝尔曼方程可计算且稳定,避免对两个独立评论家的需求。
  • 应用截断软策略梯度,通过限制策略改进的幅度来确保稳定的策略更新。
  • 使用包含 300 万条过渡数据的经验回放缓冲区,以每 100 个样本为小批量进行训练,每 4 个环境步骤更新一次策略。
  • 采用 Adam 优化器,为演员和评论家分别设置独立的学习率,并使用软目标更新策略,更新系数为 0.01,以增强稳定性。

实验结果

研究问题

  • RQ1能否在最大熵框架下,推导出一种软策略梯度方法,实现在高维连续控制任务中的稳定离策略学习?
  • RQ2与先前的软 Q 学习方法相比,软贝尔曼方程中使用双采样如何提升稳定性并消除对两个评论家的需求?
  • RQ3在标准连续控制基准测试中,DSPG 相较于 DDPG 和 SAC 在样本效率和最终性能方面提升了多少?
  • RQ4软策略梯度与基于双采样的软 Q 函数学习相结合,是否能带来更鲁棒和稳定的训练动态?
  • RQ5DSPG 是否能在状态空间和动作空间维度各异的任务(如 3D 人形机器人运动)中实现有效泛化?

主要发现

  • 在所有四个基准环境(Ant-v2、HalfCheetah-v2、Hopper-v2 和 Walker2d-v2)中,DSPG 在最终性能和样本效率方面均显著优于 DDPG。
  • 在 Hopper-v2 和 Walker2d-v2 上,DSPG 分别获得 3674.029 和 6060.884 的平均总奖励,优于 SAC 的 3652.893 和 5520.419。
  • 在 Ant-v2 上,DSPG 达到最佳平均总奖励 3384.074,优于 DDPG 的 1012.242,并与 SAC 的最佳性能 3472.346 相当。
  • 训练曲线显示,DSPG 在所有任务中均表现出优于 SAC 的稳定性,方差更小且性能持续提升。
  • 采用截断软策略梯度与单个评论家结合双采样,有助于降低近似误差并增强训练稳定性。
  • 尽管仅使用单个评论家,DSPG 的性能仍与依赖两个评论家的 SAC 相当,证明了双采样方法的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。