[论文解读] Neural Logic Reinforcement Learning
该论文提出神经逻辑强化学习(NLRL),一种新颖的框架,将可微分归纳逻辑编程(DILP)与策略梯度方法结合,以在强化学习中学习可解释、可泛化的策略。NLRL 将策略表示为一阶逻辑规则,在积木操作和悬崖行走任务中实现了接近最优的性能,同时实现了人类可读、逻辑结构化的决策过程,并在环境变化中表现出强大的泛化能力。
Deep reinforcement learning (DRL) has achieved significant breakthroughs in various tasks. However, most DRL algorithms suffer a problem of generalizing the learned policy which makes the learning performance largely affected even by minor modifications of the training environment. Except that, the use of deep neural networks makes the learned policies hard to be interpretable. To address these two challenges, we propose a novel algorithm named Neural Logic Reinforcement Learning (NLRL) to represent the policies in reinforcement learning by first-order logic. NLRL is based on policy gradient methods and differentiable inductive logic programming that have demonstrated significant advantages in terms of interpretability and generalisability in supervised tasks. Extensive experiments conducted on cliff-walking and blocks manipulation tasks demonstrate that NLRL can induce interpretable policies achieving near-optimal performance while demonstrating good generalisability to environments of different initial states and problem sizes.
研究动机与目标
- 解决深度强化学习(DRL)策略中可解释性与泛化能力不足的问题。
- 在序列决策任务中,利用一阶逻辑表示实现策略学习。
- 利用可微分归纳逻辑编程(DILP)实现强化学习中可扩展、可解释的策略归纳。
- 在无需已知环境动力学的情况下,提升策略在不同初始状态和问题规模下的泛化能力。
- 将 DILP 扩展至监督任务之外,应用于强化学习,实现在决策过程中无监督的概念发现。
提出的方法
- NLRL 将策略梯度强化学习与可微分归纳逻辑编程(DILP)相结合,以一阶逻辑规则的形式学习策略。
- 该框架使用可微分逻辑网络,通过基于梯度的学习端到端表示并优化逻辑规则。
- 策略以一组新发明的谓词(例如 pred1, pred2)的层次结构表示,逐步构建至动作决策(例如 move, up, right)。
- 模型通过策略梯度目标进行训练,其中策略由逻辑规则参数化,并通过 DILP 模块实现可微分。
- 系统学习诱导出辅助谓词,以捕捉状态空间中的关系结构,从而实现抽象、可解释的推理。
- 最终动作策略通过在学习到的规则上进行前向链推理获得,每条规则均附带置信度分数。
实验结果
研究问题
- RQ1一阶逻辑规则能否有效用于表示和学习深度强化学习中的可解释策略?
- RQ2基于 DILP 的策略是否能在强化学习环境中对不同初始状态和问题规模实现泛化?
- RQ3将 DILP 与策略梯度结合,是否能生成既接近最优又人类可读的策略?
- RQ4NLRL 在复杂序列任务中的可解释性与泛化能力相较于标准 DRL 模型表现如何?
- RQ5NLRL 能否在无须人工提供概念的情况下,发现有用的关联抽象(例如,顶层积木、与地面接触的积木)?
主要发现
- NLRL 在积木操作和悬崖行走任务中均实现了接近最优的性能,智能体学习到的策略具有可解释性且逻辑结构清晰。
- 在 STACK 任务中,智能体诱导出如 move(X,Y) ← pred3(Y), pred4(X,Y) 的规则,其中 pred3 用于识别至少包含两个积木的列中的顶层积木。
- 悬崖行走任务的诱导策略包含如 up() ← current(X,Y), zero(Y) 的规则,能正确识别从底行向上移动的动作。
- 尽管存在次优行为(如不必要的向下移动),策略仍保持逻辑一致且可解释,置信度分数反映了规则的可靠性。
- 该框架展现出强大的泛化能力,在不同初始位置和问题规模下均保持性能稳定,即使最优策略未被完全学习。
- 系统通过无监督规则归纳成功发现了抽象关系概念(如与地面接触的积木、顶层积木),而无需人工标注。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。