Skip to main content
QUICK REVIEW

[论文解读] Interpretable Model-based Hierarchical Reinforcement Learning using Inductive Logic Programming

Duo Xu, Faramarz Fekri|arXiv (Cornell University)|Jun 21, 2021
Reinforcement Learning in Robotics参考文献 42被引用 6
一句话总结

本文提出了一种分层强化学习框架,利用归纳逻辑编程(ILP)学习可解释的符号化转移模型,从而在基于模型的强化学习中提升数据效率与可解释性。通过在无先验知识的情况下学习状态转移的逻辑规则,该方法相较基线方法将学习速度提高了30–40%,并实现了跨环境的组合泛化能力。

ABSTRACT

Recently deep reinforcement learning has achieved tremendous success in wide ranges of applications. However, it notoriously lacks data-efficiency and interpretability. Data-efficiency is important as interacting with the environment is expensive. Further, interpretability can increase the transparency of the black-box-style deep RL models and hence gain trust from the users. In this work, we propose a new hierarchical framework via symbolic RL, leveraging a symbolic transition model to improve the data-efficiency and introduce the interpretability for learned policy. This framework consists of a high-level agent, a subtask solver and a symbolic transition model. Without assuming any prior knowledge on the state transition, we adopt inductive logic programming (ILP) to learn the rules of symbolic state transitions, introducing interpretability and making the learned behavior understandable to users. In empirical experiments, we confirmed that the proposed framework offers approximately between 30\% to 40\% more data efficiency over previous methods.

研究动机与目标

  • 解决深度强化学习(RL)在长时序任务中数据效率低下及缺乏可解释性的问题。
  • 在无需了解环境动力学先验知识的前提下,通过符号化状态转移实现高层规划。
  • 通过归纳逻辑编程(ILP)学习符号化转移模型,提升样本效率。
  • 通过人类可读的逻辑规则描述状态转移,引入可解释性。
  • 通过符号规则迁移,实现对未见过的环境的组合泛化能力。

提出的方法

  • 利用分层强化学习,结合高层智能体、子任务求解器与符号化转移模型,将长时序任务分解。
  • 使用归纳逻辑编程(ILP)从真实环境交互中自动学习符号化转移规则,无需预先了解状态动力学。
  • 将精炼操作引入∂ILP算法,更高效地生成子句,并避免生成无意义规则。
  • 采用符号化转移模型,使高层策略能在符号化模型上学习,从而减少与真实环境的交互次数。
  • 结合表格Q-learning与PPO分别用于高层与低层策略学习,符号规则指导子任务规划。
  • 定义符号谓词(如CurAct、Connect、isRed)以逻辑形式表示状态条件与子目标达成情况。

实验结果

研究问题

  • RQ1在无环境动力学先验知识的前提下,ILP能否有效用于基于模型的分层强化学习中学习符号化转移模型?
  • RQ2学习符号化转移规则在长时序强化学习任务中如何提升数据效率?
  • RQ3该符号化模型在不同子目标数量的新环境中,其泛化能力达到何种程度?
  • RQ4所学习的逻辑规则能否提供可解释且可验证的智能体决策过程说明?
  • RQ5将精炼机制集成到∂ILP中,如何提升规则学习的质量与效率?

主要发现

  • 所提方法在网格世界与机器人导航任务中,相较基线分层强化学习方法,实现了约30–40%更高的数据效率。
  • 在机器人导航环境中,即使低层策略表现不佳,该方法仍相较分层基线将学习时间减少了约40%。
  • 训练期间学习到的符号化转移模型在测试环境中(包含更多圆圈与颜色)实现了更快的学习速度,展现出强大的组合泛化能力。
  • ILP生成的规则明确编码了约束条件(如“必须先访问红色再访问黄色”),且具有可解释性,体现了系统的透明性。
  • 将精炼机制集成到∂ILP中,减少了无意义子句的数量,并消除了对预定义规则模板的依赖。
  • 符号化模型使高层智能体在低层策略尚未完全训练完成时即可有效规划,从而加速了整体学习过程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。