[论文解读] Reinforcement Learning with External Knowledge by using Logical Neural Networks
本文提出了一种强化学习框架,通过可微分逻辑神经网络(LNNs)整合外部知识,以加速学习并提升安全性。通过将逻辑约束编码为可训练规则,该方法实现了动作屏蔽(禁止无效动作)和动作引导(推荐最优动作),从而在不使用外部约束的情况下,比无模型强化学习收敛更快。
Conventional deep reinforcement learning methods are sample-inefficient and usually require a large number of training trials before convergence. Since such methods operate on an unconstrained action set, they can lead to useless actions. A recent neuro-symbolic framework called the Logical Neural Networks (LNNs) can simultaneously provide key-properties of both neural networks and symbolic logic. The LNNs functions as an end-to-end differentiable network that minimizes a novel contradiction loss to learn interpretable rules. In this paper, we utilize LNNs to define an inference graph using basic logical operations, such as AND and NOT, for faster convergence in reinforcement learning. Specifically, we propose an integrated method that enables model-free reinforcement learning from external knowledge sources in an LNNs-based logical constrained framework such as action shielding and guide. Our results empirically demonstrate that our method converges faster compared to a model-free reinforcement learning method that doesn't have such logical constraints.
研究动机与目标
- 通过整合外部可解释知识,解决深度强化学习中的样本效率低下问题。
- 通过使用逻辑规则约束动作空间,减少训练尝试次数。
- 通过可微分框架将逻辑推理与深度强化学习结合,提升学习速度与安全性。
- 评估LNN在为强化学习提供可解释、可训练的逻辑约束方面的有效性。
- 比较基于LNN的强化学习中动作屏蔽与动作引导机制在性能提升方面的表现。
提出的方法
- 该方法使用逻辑神经网络(LNNs)将外部知识表示为可微分的逻辑规则,例如与(AND)、非(NOT)和蕴含(IMPLY)操作。
- 通过检测强化学习生成的动作与逻辑约束之间的矛盾来实现动作屏蔽,例如防止重新访问已探索过的房间。
- 通过基于真值的评分函数计算动作概率,该函数对矛盾损失进行折扣:$ v(a,s_t) = \frac{lower_{a,s_t} + upper_{a,s_t}}{2} - ctrd(a,s_t) $。
- 最终动作通过结合基于DQN的策略的Q值与LNN提供的动作概率的ε-greedy策略选择。
- LNN通过矛盾损失进行端到端训练,以最小化逻辑不一致性,同时保持可解释性。
- 语义解析从自然语言环境描述中提取逻辑状态命题(例如,“找到西边的房间”)。
实验结果
研究问题
- RQ1通过LNN编码的外部逻辑知识是否能提升无模型强化学习的样本效率?
- RQ2通过逻辑约束实现的动作屏蔽如何影响收敛速度与训练稳定性?
- RQ3使用LNN提供的概率进行动作引导是否比仅使用屏蔽机制带来更快的收敛速度?
- RQ4LNN规则的可解释性如何支持对学习到的约束的验证与优化?
- RQ5在复杂、部分可观察的环境(如基于文本的游戏)中,基于LNN的逻辑约束是否能优于无约束的强化学习?
主要发现
- LNNs-Shielding通过阻止无用动作(如重新访问已探索房间)改善了基线模型的收敛性。
- LNNs-Guide由于提供了正向动作推荐,收敛速度显著快于基线模型和LNNs-Shielding。
- 奖励曲线显示,LNNs-Guide达到了更高的平均奖励与更低的标准差,表明学习过程更稳定。
- 该方法表明,通过LNN整合逻辑约束可显著减少达到最优性能所需的训练episode数。
- LNN规则的可解释性使得逻辑一致性得以验证,有助于检测并纠正规则制定中的潜在错误。
- 结果证实,LNN为结合符号推理与深度强化学习提供了可行路径,可实现更安全、更快、更高效的训练。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。