Skip to main content
QUICK REVIEW

[论文解读] Hierarchical Reinforcement Learning with Hindsight

Andrew Levy, Robert W. Platt|arXiv (Cornell University)|May 21, 2018
Reinforcement Learning in Robotics参考文献 16被引用 42
一句话总结

该论文提出一种方法,通过将普适价值函数与事后学习相结合,在多种抽象层次学习时序延长动作,使时间尺度并行学习成为可能,并提高离散与连续任务的样本效率。

ABSTRACT

Reinforcement Learning (RL) algorithms can suffer from poor sample efficiency when rewards are delayed and sparse. We introduce a solution that enables agents to learn temporally extended actions at multiple levels of abstraction in a sample efficient and automated fashion. Our approach combines universal value functions and hindsight learning, allowing agents to learn policies belonging to different time scales in parallel. We show that our method significantly accelerates learning in a variety of discrete and continuous tasks.

研究动机与目标

  • 解决具有延迟和稀疏奖励的强化学习样本效率问题。
  • 实现多抽象层次上对时序延长动作的学习。
  • 开发一种在不同时间尺度并行学习策略的方法。
  • 将普遍价值函数与事后学习整合,以促进多时间尺度学习。

提出的方法

  • 使用普遍价值函数来表示跨不同目标和时间尺度的价值。
  • 融入事后学习,以用替代目标重新表述过去经验,获得更丰富的学习信号。
  • 在单一框架中实现对多个时间尺度(或时间视界)的策略并行学习。
  • 利用层级结构在不同抽象层次学习行动,以样本高效的方式。
  • 将该方法应用于离散和连续控制任务,以展示其通用性。

实验结果

研究问题

  • RQ1普遍价值函数与事后学习相结合,是否能在多时间尺度上支持对时序延长动作的学习?
  • RQ2所提出的层级方法在离散与连续任务中相较于扁平化RL基线,是否能提高样本效率?
  • RQ3不同时间视界的策略是否可以在不相互干扰的情况下并行学习?
  • RQ4基于事后重标记对学习速度和策略质量在层级水平上的影响如何?
  • RQ5在RL中自动化实现多时间尺度学习的实际好处与局限性是什么?

主要发现

  • 该方法在各种离散任务中加速了学习。
  • 该方法在各种连续任务中加速了学习。
  • 在多时间尺度上并行学习,提高了样本效率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。