Skip to main content
QUICK REVIEW

[论文解读] Learning World Graphs to Accelerate Hierarchical Reinforcement Learning

Wenling Shang, Alex Trott|arXiv (Cornell University)|Jul 1, 2019
Reinforcement Learning in Robotics被引用 10
一句话总结

本文提出一种两阶段框架,通过无监督探索从环境中学习世界图——包括关键状态和可 travers 的边——以加速分层强化学习(HRL)。通过使用好奇心驱动的目标条件策略和可微分的二值潜在模型,该方法发现关键状态及其连接,使高层管理者能够发出“先广后窄”的指令,引导低层工作者通过图遍历高效解决下游任务,显著提升了样本效率和性能,优于基线方法。

ABSTRACT

In many real-world scenarios, an autonomous agent often encounters various tasks within a single complex environment. We propose to build a graph abstraction over the environment structure to accelerate the learning of these tasks. Here, nodes are important points of interest (pivotal states) and edges represent feasible traversals between them. Our approach has two stages. First, we jointly train a latent pivotal state model and a curiosity-driven goal-conditioned policy in a task-agnostic manner. Second, provided with the information from the world graph, a high-level Manager quickly finds solution to new tasks and expresses subgoals in reference to pivotal states to a low-level Worker. The Worker can then also leverage the graph to easily traverse to the pivotal states of interest, even across long distance, and explore non-locally. We perform a thorough ablation study to evaluate our approach on a suite of challenging maze tasks, demonstrating significant advantages from the proposed framework over baselines that lack world graph knowledge in terms of performance and efficiency.

研究动机与目标

  • 为解决复杂多任务环境中分层强化学习存在的样本效率低下和泛化能力差的问题。
  • 发现一种紧凑且有意义的世界抽象(有向加权图),在无需人工提供地标的情况下捕捉环境的结构本质。
  • 通过将世界图知识整合到具有新颖目标指令与导航机制的分层策略中,加速下游任务的学习。
  • 通过在世界图发现阶段学习的、好奇心驱动的目标条件策略初始化HRL策略,实现快速迁移学习。

提出的方法

  • 训练一个具有二值潜在变量的循环变分自编码器,以识别关键状态——即能够重建动作轨迹的关键状态。
  • 采用无监督探索策略,交替进行随机游走和好奇心驱动的目标条件策略,以收集多样化的轨迹用于世界图学习。
  • 世界图中的边基于相邻关键状态之间的可行且可操作的转移而构建,这些转移同时来自轨迹和目标条件策略。
  • 提出一种新颖的“先广后窄”(WN)指令机制,使高层管理者可先选择一个关键状态,再在其局部邻域内指定目标。
  • 低层工作者使用图遍历算法(如Dijkstra类算法)在关键状态之间高效导航,从而实现长距离、非局部的探索。
  • 在世界图发现阶段学习到的目标条件策略被重用于初始化HRL策略,实现对新任务的快速迁移。

实验结果

研究问题

  • RQ1能否通过自监督、无监督的方法有效发现代表复杂环境结构主干的关键状态?
  • RQ2将学习到的世界图集成到分层强化学习中,如何提升样本效率和最终性能?
  • RQ3与标准目标条件化HRL相比,'先广后窄'指令机制在收敛速度和解质量方面有多大优势?
  • RQ4世界图抽象是否能在不重新训练的情况下泛化到多种不同的下游任务?
  • RQ5通过在世界图发现阶段学习到的好奇心驱动策略初始化HRL策略,是否能带来新任务上的更快收敛?

主要发现

  • 学习到的世界图显著提升了样本效率:使用世界图的模型比无世界图的基线模型收敛更快,最终性能更高。
  • 与随机状态(Vrand)相比,使用关键状态(Vp)可降低不同随机种子下的性能方差,并在非确定性环境中表现出更一致且更优的结果。
  • 图遍历机制加速了学习过程,训练曲线显示启用遍历时收敛速度更快。
  • “先广后窄”指令机制优于标准目标条件化方法,因其利用图结构引导管理者选择更有效的子目标。
  • 使用世界图发现阶段学习到的目标条件策略(πg)进行初始化,带来了明显的性能优势,证明了技能的有效迁移。
  • 消融实验表明,所有组件——关键状态发现、图遍历、WN指令机制以及πg初始化——均对整体性能提升有显著贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。