Skip to main content
QUICK REVIEW

[论文解读] Hierarchical Reinforcement Learning with Abductive Planning

Kazeto Yamamoto, Takashi Onishi|arXiv (Cornell University)|Jun 28, 2018
Reinforcement Learning in Robotics参考文献 20被引用 10
一句话总结

该论文提出了一种分层强化学习框架,将归纳逻辑编程(ILP)驱动的类溯推理符号规划与深度强化学习相结合,以提升在复杂、部分可观测环境中的样本效率。通过采用基于ILP的类溯推理而非基于Herbrand的推理,该方法支持用户定义的奖励函数,并可在未知状态空间中运行,显著加速了在具有多个目标的Minecraft类环境中的学习过程。

ABSTRACT

One of the key challenges in applying reinforcement learning to real-life problems is that the amount of train-and-error required to learn a good policy increases drastically as the task becomes complex. One potential solution to this problem is to combine reinforcement learning with automated symbol planning and utilize prior knowledge on the domain. However, existing methods have limitations in their applicability and expressiveness. In this paper we propose a hierarchical reinforcement learning method based on abductive symbolic planning. The planner can deal with user-defined evaluation functions and is not based on the Herbrand theorem. Therefore it can utilize prior knowledge of the rewards and can work in a domain where the state space is unknown. We demonstrate empirically that our architecture significantly improves learning efficiency with respect to the amount of training examples on the evaluation domain, in which the state space is unknown and there exist multiple goals.

研究动机与目标

  • 解决强化学习在大规模、复杂现实领域中因过度试错而导致的效率低下问题。
  • 克服现有符号规划器依赖Herbrand定理而无法处理用户定义奖励函数的局限性。
  • 利用类溯推理与先验知识,在未知状态空间和多目标环境中实现规划。
  • 通过在高层策略中整合符号类溯规划与深度强化学习,提升学习效率。

提出的方法

  • 该框架使用ILP形式化的类溯推理作为高层规划器,实现对符号知识的推理,而无需依赖Herbrand论域。
  • 类溯推理基于用户定义的评估函数(包括奖励期望)生成高层计划,从而实现领域特定知识的集成。
  • 高层规划器生成子目标序列(例如,find-coal, go-furnace),由低层PPO智能体执行。
  • 缓存机制存储并重用相同观测结果的推理结果,以提升规划速度。
  • 系统将类溯规划与基于PPO的深度强化学习相结合,其中高层规划器指导低层策略学习。
  • 该架构支持任意长度的计划,并利用证明图提升推理过程的可解释性。

实验结果

研究问题

  • RQ1基于ILP的类溯推理是否能提升在复杂、部分可观测领域中分层强化学习的样本效率?
  • RQ2非基于Herbrand的符号规划器是否能在未知状态空间环境中有效运行?
  • RQ3用户定义的奖励函数能否有效集成到符号规划中,以指导高层策略学习?
  • RQ4与标准分层强化学习相比,类溯规划的集成如何影响学习速度与性能?

主要发现

  • ABDUCTIVE在5,000个训练周期内获得的累积奖励显著高于基线模型,证明了其在学习效率上的优越性。
  • 类溯规划器生成了可解释的、基于图的解决方案假设,支持对任意长度计划和非动作知识(如物体属性)的推理。
  • 在样本效率方面,该系统优于标准分层强化学习基线模型,尤其在具有多个目标和未知状态空间的环境中表现更优。
  • 高层规划引入了性能瓶颈,部分推理步骤耗时数秒,但缓存机制显著提升了重复观测下的响应速度。
  • 该方法成功通过用户定义的评估函数利用了关于奖励的先验知识,实现了规划中的目标优先级排序。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。