Skip to main content
QUICK REVIEW

[论文解读] Hierarchical Reinforcement Learning By Discovering Intrinsic Options

Jesse Zhang, Haonan Yu|arXiv (Cornell University)|Jan 16, 2021
Reinforcement Learning in Robotics参考文献 41被引用 24
一句话总结

HIDIO 以自监督方式学习与任务无关的内在选项,并将它们联合用于解决稀疏奖励任务,在样本效率上优于基线。

ABSTRACT

We propose a hierarchical reinforcement learning method, HIDIO, that can learn task-agnostic options in a self-supervised manner while jointly learning to utilize them to solve sparse-reward tasks. Unlike current hierarchical RL approaches that tend to formulate goal-reaching low-level tasks or pre-define ad hoc lower-level policies, HIDIO encourages lower-level option learning that is independent of the task at hand, requiring few assumptions or little knowledge about the task structure. These options are learned through an intrinsic entropy minimization objective conditioned on the option sub-trajectories. The learned options are diverse and task-agnostic. In experiments on sparse-reward robotic manipulation and navigation tasks, HIDIO achieves higher success rates with greater sample efficiency than regular RL baselines and two state-of-the-art hierarchical RL methods.

研究动机与目标

  • 在无需手动设计选项的情况下,激发对稀疏奖励任务的自动任务分解。
  • 学习一个两层层级结构,其中调度器选择潜在选项,工作器执行动作。
  • 通过内在熵目标鼓励多样且与任务无关的低层选项。
  • 证明自监督选项发现能在各类机器人任务上提高成功率和效率。

提出的方法

  • 具有两级 HIDIO 架构的调度器(高层)每 KStep 输出潜在选项 u,工作器(低层)在 u 条件下执行动作。
  • 通过一个使对数后验 log-q p(u|trajectory) 的内在奖励进行选项发现,使用判别器 qψ。
  • 用参数化的判别器替代不可 tractable 的后验进行下界优化。
  • 定义一个元MDP,使工作器观测选项子轨迹,从而实现有效的辨别和信用分配。
  • 工作器目标将内在奖励与最大熵强化学习目标(SAC)结合,以实现稳定学习。
  • 对子轨迹特征(State、Action、StateDiff、StateAction、StateConcat、ActionConcat)的判别器实例化进行评估。
  • 带回放缓冲区的离策略训练、内在奖励重新标注,以及可选的重要性修正,以提高样本效率。

实验结果

研究问题

  • RQ1通过自监督方式学习的与任务无关的内在选项,是否能在稀疏奖励任务上提升性能?
  • RQ2判别器应如何在选项子轨迹上工作,以有效发现多样的选项?
  • RQ3调度器和工作器的联合训练是否优于对工作器进行固定选项的预训练?
  • RQ4不同的短视性和选项长度对学习与性能的影响是什么?
  • RQ5HIDIO 的内在选项与现有分层RL方法在操作与导航任务上的比较如何?

主要发现

  • HIDIO 在四个不同任务上实现了比 SAC、SAC+ActRepeat、HIRO 和 HiPPO 更高的最终成功率和更好的样本效率。
  • 判别器的特征选择如 Action、StateAction 和 StateDiff 通常能带来更强的性能。
  • 在具有挑战性的任务上,调度器和工作器的联合训练优于对工作器进行固定选项的预训练。
  • 学习得到的选项表现为低层级的导航与操作技能,促进探索和任务完成。
  • HIDIO 能解决基线方法困难的稀疏奖励任务,显示出内在、短期选项发现的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。