Skip to main content
QUICK REVIEW

[论文解读] PC-MLP: Model-based Reinforcement Learning with Policy Cover Guided Exploration

Yuda Song, W. Sun|arXiv (Cornell University)|Jul 15, 2021
Reinforcement Learning in Robotics被引用 5
一句话总结

PC-MLP 是一种基于模型的强化学习算法,通过策略覆盖和规划查询效率的方法,在非线性动力系统中实现高效且可证明样本高效的探索。它在稀疏奖励和密集奖励控制任务中均达到最先进性能,包括 HandEgg 和 AntMaze 等具有挑战性的环境,同时保持计算效率,并支持无奖励探索。

ABSTRACT

Model-based Reinforcement Learning (RL) is a popular learning paradigm due to its potential sample efficiency compared to model-free RL. However, existing empirical model-based RL approaches lack the ability to explore. This work studies a computationally and statistically efficient model-based algorithm for both Kernelized Nonlinear Regulators (KNR) and linear Markov Decision Processes (MDPs). For both models, our algorithm guarantees polynomial sample complexity and only uses access to a planning oracle. Experimentally, we first demonstrate the flexibility and efficacy of our algorithm on a set of exploration challenging control tasks where existing empirical model-based RL approaches completely fail. We then show that our approach retains excellent performance even in common dense reward control benchmarks that do not require heavy exploration. Finally, we demonstrate that our method can also perform reward-free exploration efficiently. Our code can be found at https://github.com/yudasong/PCMLP.

研究动机与目标

  • 为解决经验性基于模型强化学习中缺乏战略性探索的问题,此类方法在稀疏奖励或复杂动力学环境中常会失效。
  • 为核化非线性调节器(KNRs)和线性 MDP 开发一种可证明样本高效且计算高效的算法。
  • 在不依赖乐观规划查询的情况下实现高效探索,从而可与现成的规划工具集成。
  • 在多样化控制基准测试中展示强大性能,包括探索具有挑战性和密集奖励的环境。
  • 通过利用策略覆盖覆盖图,支持无奖励探索。

提出的方法

  • 该算法维护一个策略覆盖——一组先前学习到的策略的集合——以在模型拟合过程中防止灾难性遗忘。
  • 它使用一个模型学习组件,从策略覆盖中策略收集的轨迹中拟合动力学模型。
  • 应用一种受线性带多臂老虎机算法(Dani et al., 2008)启发的奖励奖金方案,以在连续状态和动作空间中促进探索。
  • 该方法仅依赖标准规划查询,避免使用计算成本高昂的乐观规划查询。
  • 一种实用的深度学习变体 Deep PC-MLP 使用深度神经网络进行动力学建模,并使用随机特征(如 RFF)实现奖励奖金。
  • 该算法集成现成的规划器(如 TRPO 和 MPPI),支持在真实世界控制任务中灵活部署。

实验结果

研究问题

  • RQ1基于模型的强化学习算法是否能在通过 RKHS 建模的非线性系统(KNRs)中实现可证明的样本效率和计算效率?
  • RQ2使用策略覆盖和标准规划查询是否能在先前方法失效的稀疏奖励环境中实现有效探索?
  • RQ3该算法是否能在无需专门探索机制的情况下,在密集奖励基准测试中保持强大性能?
  • RQ4PC-MLP 在复杂环境中能实现多大程度的高效无奖励探索?
  • RQ5与现有基线相比,该算法在实际运行时间和样本效率方面如何扩展?

主要发现

  • PC-MLP 实现了多项式样本复杂度,并具备规划查询效率,可与标准现成规划工具配合使用。
  • 在 HandEgg 环境中,PC-MLP 的学习速度显著快于 SLBO 和 MBPO,后两者依赖随机探索且无法取得进展。
  • 在 AntMaze 环境中,PC-MLP 仅使用五个策略的策略覆盖就成功探索了迷宫,展示了无需任何奖励信号的高效覆盖能力。
  • 实用的 Deep PC-MLP 实现运行时间与 PETS-GT 和 MBPO 等基线相当,仅因探索奖金计算带来适度开销。
  • 在 MountainCar 和 Acrobot 等密集奖励基准测试中,PC-MLP 使用 TRPO 和 MPPI 作为规划器均实现了优异性能。
  • 该算法在长时域任务中保持稳定性能,TRPO 由于策略更新中振荡减少而优于 MPPI。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。