Skip to main content
QUICK REVIEW

[论文解读] PlanGAN: Model-based Planning With Sparse Rewards and Multiple Goals

Henry Charlesworth, Giovanni Montana|arXiv (Cornell University)|Jun 1, 2020
Reinforcement Learning in Robotics参考文献 39被引用 18
一句话总结

PlanGAN 是一种基于模型的强化学习算法,利用一组条件生成对抗网络(conditional GANs)生成符合目标导向的合理轨迹,从而在稀疏奖励、多目标环境中实现高效的规划。其性能与当前最先进的无模型方法(如Hindsight Experience Replay, HER)相当,同时在样本效率上高出4至8倍。

ABSTRACT

Learning with sparse rewards remains a significant challenge in reinforcement learning (RL), especially when the aim is to train a policy capable of achieving multiple different goals. To date, the most successful approaches for dealing with multi-goal, sparse reward environments have been model-free RL algorithms. In this work we propose PlanGAN, a model-based algorithm specifically designed for solving multi-goal tasks in environments with sparse rewards. Our method builds on the fact that any trajectory of experience collected by an agent contains useful information about how to achieve the goals observed during that trajectory. We use this to train an ensemble of conditional generative models (GANs) to generate plausible trajectories that lead the agent from its current state towards a specified goal. We then combine these imagined trajectories into a novel planning algorithm in order to achieve the desired goal as efficiently as possible. The performance of PlanGAN has been tested on a number of robotic navigation/manipulation tasks in comparison with a range of model-free reinforcement learning baselines, including Hindsight Experience Replay. Our studies indicate that PlanGAN can achieve comparable performance whilst being around 4-8 times more sample efficient.

研究动机与目标

  • 解决在稀疏奖励和多目标强化学习环境中训练策略的挑战,因为标准方法因反馈稀疏而难以奏效。
  • 通过引入一种基于模型的替代方法,克服无模型方法(如HER)的样本低效问题,更有效地利用轨迹信息。
  • 开发一种方法,能够基于期望目标生成多样化且合理的未来轨迹,从而在无需与真实环境交互的情况下实现高效规划。
  • 通过学习动力学模型并利用其规划想象中的轨迹,提升机器人操作和导航任务中的数据效率。
  • 证明基于模型的规划结合条件生成对抗网络可达到与无模型方法相当的渐近性能,同时显著减少与环境的交互次数。

提出的方法

  • 训练一组生成对抗网络(GANs)以基于初始状态和目标状态生成未来轨迹,学习生成合理的行为和状态序列。
  • 在 GAN 训练过程中使用一步预测模型作为正则化项,以提高短时程内生成轨迹的准确性和一致性。
  • 实现一种规划算法,通过基于轨迹的可能性和目标可达性对多个想象中的轨迹进行评分,从而在每一步选择最优动作。
  • 将生成的轨迹整合为类似蒙特卡洛的规划过程,无需与真实环境交互即可模拟未来结果。
  • 利用轨迹中观察到的任意目标,可将早期状态重新视为实现该目标的起点,类似于 HER 的思想,但在基于模型的生成框架中实现。
  • 使用一种规划器,通过滚动展开多个想象中的轨迹来评估每个候选动作的成功概率,并选择期望回报最高的动作。

实验结果

研究问题

  • RQ1基于模型的方法是否能在稀疏奖励、多目标环境中实现与无模型方法(如 HER)相当的性能,同时显著提升样本效率?
  • RQ2条件生成对抗网络在生成多样化、合理且目标导向的轨迹方面,对复杂控制任务的规划效果如何?
  • RQ3规划组件对整体方法性能的影响有多大?是否可以被替代或简化而不损失性能?
  • RQ4在长时程任务中,GAN 集成中的 GAN 数量如何影响训练稳定性和最终性能?
  • RQ5将一步预测模型作为正则化项,对提升生成轨迹的质量和可靠性有多大帮助?

主要发现

  • PlanGAN 的性能与当前最先进的无模型方法 Hindsight Experience Replay (HER) 相当,后者是稀疏奖励、多目标强化学习的领先方法。
  • 在多个机器人操作和导航任务中,PlanGAN 的样本效率比 HER 高 4 至 8 倍,达到相同性能水平所需的环境交互次数显著更少。
  • 专用规划器至关重要:若移除规划器并直接使用 GAN 预测的动作,成功率将大幅下降,表明规划器在轨迹评估和动作选择中起关键作用。
  • 使用 5 个 GAN 的集成比使用 1 个或 3 个 GAN 的小规模集成略好,但提升有限,表明在合理范围内对集成规模具有鲁棒性。
  • 一步预测模型正则化项仅带来微小改进,表明其并非性能的关键组件,尽管可能有助于训练稳定性。
  • 即使无法访问自生成的演示(如 SLD 中的情况),PlanGAN 在数据效率方面仍优于该方法,证明其在稀疏奖励设置下生成式规划机制的强大优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。