Skip to main content
QUICK REVIEW

[论文解读] Discovery of Options via Meta-Learned Subgoals

Vivek Veeriah, Tom Zahavy|arXiv (Cornell University)|Feb 12, 2021
Reinforcement Learning in Robotics参考文献 48被引用 5
一句话总结

本文提出MODAC,一种元梯度方法,通过元优化学习子目标定义的选项奖励和终止条件,在多任务强化学习中发现与任务无关的选项。该方法通过在多个任务上联合优化,识别出可重用且多样化的选项,从而实现更快的学习速度并提升对未见任务的迁移性能。

ABSTRACT

Temporal abstractions in the form of options have been shown to help reinforcement learning (RL) agents learn faster. However, despite prior work on this topic, the problem of discovering options through interaction with an environment remains a challenge. In this paper, we introduce a novel meta-gradient approach for discovering useful options in multi-task RL environments. Our approach is based on a manager-worker decomposition of the RL agent, in which a manager maximises rewards from the environment by learning a task-dependent policy over both a set of task-independent discovered-options and primitive actions. The option-reward and termination functions that define a subgoal for each option are parameterised as neural networks and trained via meta-gradients to maximise their usefulness. Empirical analysis on gridworld and DeepMind Lab tasks show that: (1) our approach can discover meaningful and diverse temporally-extended options in multi-task RL domains, (2) the discovered options are frequently used by the agent while learning to solve the training tasks, and (3) that the discovered options help a randomly initialised manager learn faster in completely new tasks.

研究动机与目标

  • 为解决在多任务强化学习中自动发现有用且可重用的时间抽象(选项)的挑战,而无需人工设计的子目标。
  • 通过识别捕捉任务分布中共同规律的选项,提升样本效率与迁移学习性能。
  • 开发一种可扩展的端到端方法,通过元梯度学习选项的奖励函数与终止函数。
  • 在选项发现与下游任务学习速度方面,超越现有层次化强化学习基线方法。

提出的方法

  • 该方法采用管理者-工作者层级式强化学习架构,其中管理者选择选项与原始动作以最大化特定任务的回报。
  • 选项奖励与终止函数参数化为神经网络,并通过元梯度训练,以在多个训练任务中最大化效用。
  • 通过反向传播经过强化学习策略更新计算元梯度,使系统能够基于选项参数对整体性能的影响来优化其参数。
  • 该方法发现具有灵活时间尺度的选项,不同于先前方法对选项持续时间进行固定或约束的做法。
  • 采用联合演员-评论家框架(MODAC),使用策略梯度方法端到端训练管理者与选项策略。
  • 通过在多样化任务上联合优化选项行为与元目标性能,学习与任务无关的子目标。

实验结果

研究问题

  • RQ1元梯度能否有效用于在多任务强化学习中发现适用于任务分布的时序扩展选项?
  • RQ2所发现的选项是否捕捉到有意义、多样化且可重用的行为,从而提升学习效率?
  • RQ3在迁移性能与样本效率方面,所发现选项的性能与MLSH和Option-Critic等强基线相比如何?
  • RQ4该方法能否扩展到复杂的真实世界环境,如DeepMind Lab?
  • RQ5通过选项奖励与终止条件学习的子目标是否能实现新未见任务上的更快学习?

主要发现

  • MODAC在网格世界与DeepMind Lab环境中成功发现有意义且多样的时序扩展选项,经由选项策略的定性可视化得到验证。
  • 在训练过程中,该代理频繁使用所发现的选项,表明其在跨任务策略优化中发挥了积极作用。
  • 在DeepMind Lab任务中,MODAC在新未见任务上的学习速度优于Flat代理及两种强基线(MLSH与Option-Critic),展现出更优的迁移性能。
  • 即使仅使用500万或1000万训练样本,MODAC在使用全部样本时仍优于Flat代理,表明其具备良好的可扩展性与样本效率。
  • 在测试任务上的学习速度与最终性能方面,MODAC优于MLSH与Option-Critic,尤其在需要迁移的场景下优势更明显。
  • 消融研究证实,采用元梯度学习选项奖励与终止函数的方法,是发现有用且可重用选项的关键。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。