Skip to main content
QUICK REVIEW

[论文解读] A Meta-MDP Approach to Exploration for Lifelong Reinforcement Learning

Francisco Moreno, Philip S. Thomas|arXiv (Cornell University)|Feb 3, 2019
Reinforcement Learning in Robotics参考文献 29被引用 11
一句话总结

本文提出了一种元-MDP框架,使终身强化学习智能体能够通过利用相关任务中的先前经验,学习到一种最优探索策略。通过将探索策略搜索建模为元-MDP问题,智能体在探索过程中选择的动作能够加速在新任务上的学习,相较于MAML,在Hopper等连续控制任务中实现了高达4倍的回报提升。

ABSTRACT

In this paper we consider the problem of how a reinforcement learning agent that is tasked with solving a sequence of reinforcement learning problems (a sequence of Markov decision processes) can use knowledge acquired early in its lifetime to improve its ability to solve new problems. We argue that previous experience with similar problems can provide an agent with information about how it should explore when facing a new but related problem. We show that the search for an optimal exploration strategy can be formulated as a reinforcement learning problem itself and demonstrate that such strategy can leverage patterns found in the structure of related problems. We conclude with experiments that show the benefits of optimizing an exploration strategy using our proposed approach.

研究动机与目标

  • 为解决终身强化学习中探索效率低下这一挑战,即智能体在新任务上通常从零开始重新学习。
  • 将寻找最优探索策略的形式化为元-MDP问题,实现相关任务间探索策略的迁移。
  • 证明先前任务的经验可用于学习一种通用探索策略,从而加速在新任务上的学习。
  • 表明通过元强化学习学习探索策略,相较于标准方法(如MAML或随机探索)具有更高的样本效率。

提出的方法

  • 本文将寻找最优探索策略的问题建模为元-MDP,其中每个回合对应一个任务求解强化学习智能体的生命周期。
  • 元智能体通过观察在一系列先前遇到的MDP上探索的结果,学习探索策略。
  • 在元-MDP上使用强化学习优化探索策略,目标是最大化新任务上的累积回报。
  • 该方法区分了探索(由学习到的策略引导)与利用(由任务特定策略引导),使智能体能够专注于高效探索。
  • 元-MDP使用PPO和REINFORCE等算法进行训练,探索行为通过内在奖励和先前任务的经验进行塑造。
  • 该框架在离散控制和连续控制任务上进行了评估,包括平衡杆、动物仿生、Hopper和Ant,超参数经过调优以确保稳定性和性能。

实验结果

研究问题

  • RQ1能否利用与相关MDP的先前经验,为终身RL中的新任务学习到更有效的探索策略?
  • RQ2通过元强化学习学习探索策略,相较于ε-greedy或随机动作选择等标准探索策略,在样本效率方面表现如何?
  • RQ3与MAML等方法相比,元学习的探索策略在多大程度上能加速新任务上的学习?
  • RQ4该元-MDP方法是否能在不同任务类别(包括离散和连续控制环境)之间泛化?
  • RQ5当新任务具有不同的动力学特性或状态-动作空间结构时,所学习的探索策略是否仍能有效迁移?

主要发现

  • 在动物仿生任务类中,使用REINFORCE的顾问(advisor)相较于MAML将性能提升了近50%,平均回报从-779.62提升至-387.27。
  • 在连续控制任务中,Hopper任务使用PPO的顾问方法使回报提升了12倍(164.43 vs. 13.82),表明样本效率显著提升。
  • 在连续平衡杆任务中,使用PPO的顾问方法实现了438.13的平均回报,几乎是PPO单独使用时的15倍(29.95),表明学习速度显著加快。
  • 在Ant任务中,尽管MAML的平均回报更高,但顾问方法表现出更低的方差,且仍优于基线PPO,表明学习过程更加稳定。
  • 仅靠探索策略无法完成任务,证实其并非通用的利用策略,但与任务特定策略结合后能显著提升学习效率。
  • 在所有任务中,顾问方法在500个回合内持续优于基线方法,表现出更快的收敛速度和更高的样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。