Skip to main content
QUICK REVIEW

[论文解读] Landmark-Guided Subgoal Generation in Hierarchical Reinforcement Learning

Junsu Kim, Younggyo Seo|arXiv (Cornell University)|Oct 26, 2021
Reinforcement Learning in Robotics参考文献 52被引用 19
一句话总结

本文提出HIGL,一种分层强化学习框架,通过利用基于覆盖度和新颖性标准筛选出的标志性状态(landmarks)来引导子目标生成,从而提升探索效率。通过构建基于标志性状态的图结构,并在通往目标的最短路径上选择最近的标志性状态,HIGL缩小了高层策略的动作空间,在长时程控制任务中表现优异,包括在稀疏奖励的Ant Maze环境中实现65.1%的成功率,显著优于HRAC的17.6%。

ABSTRACT

Goal-conditioned hierarchical reinforcement learning (HRL) has shown promising results for solving complex and long-horizon RL tasks. However, the action space of high-level policy in the goal-conditioned HRL is often large, so it results in poor exploration, leading to inefficiency in training. In this paper, we present HIerarchical reinforcement learning Guided by Landmarks (HIGL), a novel framework for training a high-level policy with a reduced action space guided by landmarks, i.e., promising states to explore. The key component of HIGL is twofold: (a) sampling landmarks that are informative for exploration and (b) encouraging the high-level policy to generate a subgoal towards a selected landmark. For (a), we consider two criteria: coverage of the entire visited state space (i.e., dispersion of states) and novelty of states (i.e., prediction error of a state). For (b), we select a landmark as the very first landmark in the shortest path in a graph whose nodes are landmarks. Our experiments demonstrate that our framework outperforms prior-arts across a variety of control tasks, thanks to efficient exploration guided by landmarks.

研究动机与目标

  • 解决由于高层动作空间过大导致的在目标条件分层强化学习中探索效率低下的问题。
  • 提升在稀疏奖励的长时程连续控制任务中的样本效率和训练性能。
  • 开发一种通过聚焦于有前景且信息丰富的状态(即标志性状态)来缩小高层策略动作空间的方法。
  • 通过选择兼具多样性(覆盖度)和新颖性(预测误差)的标志性状态来引导子目标生成,从而增强探索能力。
  • 实现在不依赖领域特定知识或预定义子目标空间的前提下,可扩展且高效的子目标发现。

提出的方法

  • 通过两种标准采样标志性状态:(a) 基于覆盖度的采样,以最大化已访问状态在空间中的分散程度;(b) 基于新颖性的采样,利用状态自编码器的预测误差识别稀有或未探索的状态。
  • 构建一个标志性状态图,其中节点包括采样的标志性状态、当前状态和目标状态,以支持最短路径规划,识别出最紧迫的标志性状态。
  • 高层策略被训练为生成指向所选标志性状态的子目标,从而有效缩小动作空间至可到达且有前景的方向。
  • 标志性状态的选择过程在标志性状态图上使用Dijkstra算法,以找到从当前状态到目标的最短路径上的首个标志性状态。
  • 该框架可与现有的目标条件分层强化学习架构集成,使用相同的低层策略和奖励塑造方法,仅修改高层策略的动作空间和训练目标。
  • 该方法仅在训练阶段运行,推理阶段无规划开销,从而保持部署效率。

实验结果

研究问题

  • RQ1基于标志性状态的子目标引导是否能在提升探索效率的同时缩小高层策略的动作空间?
  • RQ2基于覆盖度和基于新颖性的标志性状态采样方案在促进多样化和高效探索方面有何差异?
  • RQ3选择通往目标的最短路径上最近的标志性状态,是否能带来比均匀采样或k-邻近区域方法更快的收敛速度和更高的成功率?
  • RQ4HIGL在稀疏奖励环境中(探索尤为困难)能多大程度上提升性能?
  • RQ5标志性状态引导的子目标生成能否有效扩展至高维状态空间(如基于图像的观测)?

主要发现

  • 在Ant Maze(稀疏)环境中,HIGL实现了65.1%的成功率,显著优于HRAC在相同条件下的17.6%。
  • 在Ant Maze(U型,密集)环境中,HIGL展现出更优的样本效率:基于覆盖度的标志性状态分布于已访问区域,而基于新颖性的标志性状态则集中于探索的前沿区域。
  • 结合基于覆盖度和新颖性的标志性状态采样方案,能实现更有效的探索,表现为更广泛的状态空间覆盖和更快的收敛速度。
  • HIGL通过聚焦于有前景且可达的标志性状态,缩小了高层策略的动作空间,从而实现更直接且高效的子目标生成。
  • 尽管训练100万时间步耗时13小时(HRAC为6小时),但HIGL的规划开销因更高的样本效率和性能而得到合理化,尤其在稀疏奖励设置中表现突出。
  • 该框架在多个MuJoCo基长时程控制任务中展现出强大的泛化能力,证实了其鲁棒性和可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。