Skip to main content
QUICK REVIEW

[论文解读] Accelerated Policy Learning with Parallel Differentiable Simulation

Jie Xu, Viktor Makoviychuk|arXiv (Cornell University)|Apr 14, 2022
Reinforcement Learning in Robotics被引用 16
一句话总结

本文提出SHAC,一种新颖的策略学习算法,利用高性能、并行可微分模拟器,加速复杂、接触丰富的控制任务中的强化学习。通过使用平滑评论家网络避免局部极小值,并采用截断学习窗口稳定梯度,SHAC在高维肌肉驱动的运动控制任务中,训练速度比当前最先进RL方法快17倍以上,同时显著提升了样本效率和实际运行时间效率。

ABSTRACT

Deep reinforcement learning can generate complex control policies, but requires large amounts of training data to work effectively. Recent work has attempted to address this issue by leveraging differentiable simulators. However, inherent problems such as local minima and exploding/vanishing numerical gradients prevent these methods from being generally applied to control tasks with complex contact-rich dynamics, such as humanoid locomotion in classical RL benchmarks. In this work we present a high-performance differentiable simulator and a new policy learning algorithm (SHAC) that can effectively leverage simulation gradients, even in the presence of non-smoothness. Our learning algorithm alleviates problems with local minima through a smooth critic function, avoids vanishing/exploding gradients through a truncated learning window, and allows many physical environments to be run in parallel. We evaluate our method on classical RL control tasks, and show substantial improvements in sample efficiency and wall-clock time over state-of-the-art RL and differentiable simulation-based algorithms. In addition, we demonstrate the scalability of our method by applying it to the challenging high-dimensional problem of muscle-actuated locomotion with a large action space, achieving a greater than 17x reduction in training time over the best-performing established RL algorithm.

研究动机与目标

  • 解决在复杂、接触丰富的控制任务中可微分模拟的局限性,其中基于梯度的优化常因局部极小值以及梯度消失/爆炸而失败。
  • 通过将可微分模拟器的解析梯度与稳健的策略优化框架结合,提升深度强化学习中的样本效率和实际运行时间。
  • 在高维任务(如肌肉驱动的人形机器人运动)上实现可扩展、高性能的策略学习,这些任务对标准RL算法而言难以处理。
  • 提供一个公平、全面的基准,比较基于梯度的方法与基于RL的方法在样本效率和实际运行时间上的表现,涵盖具有挑战性的长时域、接触丰富的环境。

提出的方法

  • 提出短时域演员-评论家(SHAC)算法,通过截断学习窗口限制反向传播长度,从而缓解梯度消失和梯度爆炸问题。
  • 使用评论家网络作为平滑代理,近似噪声较大的奖励景观,降低因策略失败和非平滑动力学导致的局部极小值影响。
  • 开发了一个基于PyTorch的GPU加速可微分模拟器,支持在多个环境上并行模拟,实现在大规模下的高效梯度计算。
  • 将可微分模拟器中的解析梯度集成到策略优化循环中,与价值函数结合以指导策略更新。
  • 采用短时域滚动策略(h=32),在梯度质量和计算效率之间取得平衡,提升训练稳定性。
  • 通过在多个环境上并行化处理,提高数据吞吐量,减少实际运行时间。

实验结果

研究问题

  • RQ1可微分模拟是否能有效加速复杂、接触丰富的控制任务(如人形机器人运动)中的策略学习?
  • RQ2基于梯度的优化如何克服长时域、非平滑控制任务中局部极小值和不稳定梯度的挑战?
  • RQ3结合可微分模拟器与基于评论家的方法是否能在样本效率和实际运行时间上超越当前最先进模型无关的RL算法?
  • RQ4并行可微分模拟在具有超过150个驱动自由度的高维控制问题中,能在多大程度上提升可扩展性?

主要发现

  • 在高维肌肉-肌腱驱动人形机器人(Humanoid MTU)任务中,SHAC相比表现最佳的现有RL算法,训练时间减少了超过17倍。
  • 在经典RL基准任务如CartPole Swing Up和Ant上,SHAC相比MBPO将实际运行时间减少高达162倍,相比REDQ减少102倍,尽管REDQ具有更高的样本效率。
  • 该方法表现出显著提升的梯度稳定性,SHAC的解析梯度保持良好行为,且与有限差分近似值接近,而标准的通过时间反向传播(BPTT)则观察到梯度爆炸现象。
  • SHAC生成的代理景观明显比原始噪声景观更平滑,即使在策略失败和不连续性存在的情况下,也能实现更可靠的优化。
  • 在所有评估任务中,包括长时域、接触丰富的环境,SHAC在样本效率和实际运行时间上均优于当前最先进RL算法(PPO、SAC、MBPO、REDQ)。
  • 该方法成功在高维任务(如Humanoid MTU)上进行训练,而REDQ和MBPO在默认超参数下均失败,证明了其卓越的可扩展性和鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。