Skip to main content
QUICK REVIEW

[论文解读] Learning Symbolic Rules for Interpretable Deep Reinforcement Learning

Zhihao Ma, Yuzheng Zhuang|arXiv (Cornell University)|Mar 15, 2021
Reinforcement Learning in Robotics参考文献 34被引用 8
一句话总结

本文提出神经符号强化学习(NSRL),一种将神经注意力网络与一阶逻辑推理相结合的框架,以实现可解释的深度强化学习。通过可微分的多跳推理学习符号规则,NSRL在Montezuma’s Revenge和Blocks World等复杂环境上实现了具有竞争力的性能,同时提取出人类可读的逻辑规则,相较于先前的神经符号方法展现出更优的可解释性与可扩展性。

ABSTRACT

Recent progress in deep reinforcement learning (DRL) can be largely attributed to the use of neural networks. However, this black-box approach fails to explain the learned policy in a human understandable way. To address this challenge and improve the transparency, we propose a Neural Symbolic Reinforcement Learning framework by introducing symbolic logic into DRL. This framework features a fertilization of reasoning and learning modules, enabling end-to-end learning with prior symbolic knowledge. Moreover, interpretability is achieved by extracting the logical rules learned by the reasoning module in a symbolic rule space. The experimental results show that our framework has better interpretability, along with competing performance in comparison to state-of-the-art approaches.

研究动机与目标

  • 通过将符号逻辑嵌入策略学习过程,解决深度强化学习(DRL)中可解释性不足的问题。
  • 减少对人工设计规则或虚拟转移模型的依赖,实现端到端学习并融入先验知识。
  • 相较于现有的可微分归纳逻辑编程(ILP)方法,提升可扩展性与内存效率。
  • 通过提取并可视化动作选择中使用的关键逻辑规则,实现内在可解释性。
  • 证明神经符号推理可在Montezuma’s Revenge等复杂、高维环境中实现具有竞争力的性能。

提出的方法

  • 提出基于多跳注意力网络的神经逻辑推理模块,用于对符号状态执行关系推理。
  • 通过注意力机制实现可微分的正向链推理,端到端地学习并推理一阶逻辑(FOL)规则。
  • 利用推理路径上的注意力权重估计规则置信度,实现高置信度符号规则的提取。
  • 采用分层强化学习(HRL)分解任务,使高层策略执行符号推理,而低层策略与环境交互。
  • 利用矩阵乘法技术高效计算关系路径,相较于传统可微分ILP方法提升可扩展性。
  • 从注意力加权路径中提取可解释的链式逻辑规则,为动作选择提供人类可读的解释。

实验结果

研究问题

  • RQ1神经符号框架是否能在深度强化学习中同时实现高性能与内在可解释性?
  • RQ2如何在不依赖人工设计规则模板或虚拟模型的前提下,将符号推理集成到深度强化学习中?
  • RQ3与现有基于ILP的方法相比,可微分神经符号强化学习框架的可扩展性与内存效率如何?
  • RQ4基于注意力的推理在多大程度上能从原始状态表示中提取出有意义且人类可读的逻辑规则?
  • RQ5该框架是否能在Montezuma’s Revenge等复杂、高维环境中实现性能突破,同时保持可解释性?

主要发现

  • NSRL在Montezuma’s Revenge和Blocks World上实现了具有竞争力的性能,其回报值与最先进方法NLRL的差距仅为0.008。
  • 相较于NLRL,NSRL将内存使用量减少2.7倍,推理时间缩短4.5倍,展现出更优的可扩展性。
  • 该框架成功从注意力加权推理路径中提取出可解释的一阶逻辑规则,如‘Move(X,Y) ← GoalOn(X,Y)’和‘Move(man,door) ← WithObject(man,key) ∧ KeyToDoor(key,door)’。
  • 在Blocks World领域,NSRL学习到五条具有高注意力置信度的独立逻辑规则,直接将状态条件与动作关联。
  • NSRL在性能与可解释性方面均优于MLP与NLM智能体,因为后两者无法提取或解释符号规则。
  • 注意力机制能有效识别最相关的关联路径,这些路径随后被解释为具有人类可读语义的逻辑规则。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。