Skip to main content
QUICK REVIEW

[论文解读] Compositional Reinforcement Learning from Logical Specifications

Kishor Jothimurugan, Suguman Bansal|arXiv (Cornell University)|Jun 25, 2021
Reinforcement Learning in Robotics参考文献 37被引用 10
一句话总结

该论文提出DiRL,一种组合式强化学习框架,通过结合基于模型的高层规划与无模型深度强化学习,从复杂逻辑规范中学习控制策略。通过将规范编码为抽象图,并使用Dijkstra风格的规划来引导子任务的实时策略学习,DiRL实现了线性样本复杂度扩展,并在长时域任务的连续控制基准测试中优于最先进基线方法。

ABSTRACT

We study the problem of learning control policies for complex tasks given by logical specifications. Recent approaches automatically generate a reward function from a given specification and use a suitable reinforcement learning algorithm to learn a policy that maximizes the expected reward. These approaches, however, scale poorly to complex tasks that require high-level planning. In this work, we develop a compositional learning approach, called DiRL, that interleaves high-level planning and reinforcement learning. First, DiRL encodes the specification as an abstract graph; intuitively, vertices and edges of the graph correspond to regions of the state space and simpler sub-tasks, respectively. Our approach then incorporates reinforcement learning to learn neural network policies for each edge (sub-task) within a Dijkstra-style planning algorithm to compute a high-level plan in the graph. An evaluation of the proposed approach on a set of challenging control benchmarks with continuous state and action spaces demonstrates that it outperforms state-of-the-art baselines.

研究动机与目标

  • 解决通过高层逻辑语言指定的复杂、长时域任务的控制策略学习挑战。
  • 克服现有基于奖励函数的强化学习方法在处理复杂任务组合时的可扩展性差的问题。
  • 开发一种方法,利用规范的结构化分解,将高层规划与低层策略学习解耦。
  • 提升在具有复杂规范的连续控制环境中样本效率与成功率。
  • 实现可扩展的、组合式的策略学习,同时保持对复杂逻辑目标的高满足概率。

提出的方法

  • 将逻辑规范转换为抽象图,其中顶点表示状态区域,边表示子任务。
  • 使用Dijkstra风格的前向搜索计算高层规划,以最大化满足规范的概率。
  • 对于路径上的每个子任务,仅在需要时通过无模型强化学习实时学习神经网络策略。
  • 通过其规划与策略学习过程,维护规范满足概率的下界。
  • 支持从已学习的路径策略中实时采样子目标区域,以实现从子目标区域中任意状态生成轨迹。
  • 该方法设计为与规范图的大小呈线性扩展,相比端到端强化学习显著降低样本复杂度。

实验结果

研究问题

  • RQ1是否一种将高层规划与按需低层策略学习交错进行的组合式强化学习框架,能在复杂逻辑规范上实现比端到端强化学习更优的样本效率?
  • RQ2利用逻辑规范的结构化分解是否能实现样本复杂度与规范规模的线性扩展?
  • RQ3该框架是否能在长时域连续控制任务中超越Spectrl、Tltl、Qrm、Hrm和R-avi等最先进方法?
  • RQ4在高维状态空间与复杂约束环境下(如Fetch机械臂环境),该方法的有效性如何?
  • RQ5当子目标区域部分受阻或可达性降低时,该方法的鲁棒性如何?

主要发现

  • DiRL在9-Rooms和Fetch环境中的学习成功概率方面,显著优于最先进基线方法,包括Spectrl、Tltl、Qrm、Hrm和R-avi。
  • DiRL的样本复杂度与规范图中边的数量大致呈线性关系,表明随着任务复杂度增加,其扩展效率优异。
  • 在9-Rooms环境中,DiRL在所需子任务数量增加时,比所有基线方法更快速地达到更高的成功概率。
  • 在高维状态空间的挑战性Fetch环境中,DiRL即使在涉及条件与顺序子目标的复杂任务中,也能学习到有效的策略。
  • 在门被阻挡或可达性降低的环境中,该方法仍保持鲁棒性,对多种规范均维持高性能。
  • 实验结果表明,DiRL的成功概率收敛速度更快且达到更高值,学习曲线显示其具备稳定且可扩展的学习特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。