[论文解读] Neurosymbolic Reinforcement Learning with Formally Verified Exploration
Revel 是一种神经符号强化学习框架,通过结合神经网络策略学习与符号化验证的安全防护罩,实现了在连续状态和动作空间中的形式化验证探索。它在神经符号策略空间中使用镜面下降法,安全地在符号与神经组件之间进行提升和投影,而无需直接验证神经网络,从而在保证可证明安全性的同时,性能优于先前的方法(如约束策略优化,CPO)。
We present Revel, a partially neural reinforcement learning (RL) framework for provably safe exploration in continuous state and action spaces. A key challenge for provably safe deep RL is that repeatedly verifying neural networks within a learning loop is computationally infeasible. We address this challenge using two policy classes: a general, neurosymbolic class with approximate gradients and a more restricted class of symbolic policies that allows efficient verification. Our learning algorithm is a mirror descent over policies: in each iteration, it safely lifts a symbolic policy into the neurosymbolic space, performs safe gradient updates to the resulting policy, and projects the updated policy into the safe symbolic subset, all without requiring explicit verification of neural networks. Our empirical results show that Revel enforces safe exploration in many scenarios in which Constrained Policy Optimization does not, and that it can discover policies that outperform those learned through prior approaches to verified exploration.
研究动机与目标
- 解决在神经网络验证计算成本过高、难以实施的连续控制环境中,实现可证明安全探索的挑战。
- 在使用现代策略梯度方法进行深度强化学习时,保持最坏情况下的安全保证,实现安全的训练。
- 克服静态安全防护罩在复杂环境中过度限制探索的局限性。
- 开发一种在训练过程中动态更新安全监控器与防护罩的学习框架,以提升策略性能。
- 将神经符号策略表示与形式化验证相结合,实现在安全关键应用中的可扩展、安全的强化学习。
提出的方法
- Revel 使用神经符号策略表示:一个用于安全的符号防护罩,以及一个用于策略优化的神经组件。
- 它在神经符号策略空间中执行镜面下降法,交替进行提升、更新和投影操作。
- 学习算法将符号防护罩安全地提升至神经策略空间,应用近似梯度更新,再将结果投影回安全的符号空间。
- 投影步骤采用模仿学习以保持安全性,避免直接验证神经网络。
- 该框架依赖形式化验证器检查符号防护罩,这些防护罩可高效验证,而训练期间神经组件保持未经验证状态。
- 它假设存在一个闭式最坏情况动力学模型 $P^\#$ 用于验证,确保在对抗性环境行为下所有动作均保持安全。
实验结果
研究问题
- RQ1我们能否在不产生高昂验证成本的前提下,利用深度神经网络策略在连续控制任务中实现形式化验证的探索?
- RQ2如何在学习过程中动态改进安全防护罩,以避免静态防护罩带来的性能限制?
- RQ3神经符号策略表示能否同时支持高效的基于梯度的学习与安全约束的高效验证?
- RQ4基于镜面下降法的神经符号策略学习算法,是否能产生比现有约束强化学习方法更安全、性能更高的策略?
- RQ5与静态或概率性安全方法相比,动态防护机制在连续动作空间中能在多大程度上提升探索效率与安全性?
主要发现
- Revel 在 Constrained Policy Optimization (CPO) 因训练期间产生不安全动作而失败的连续控制环境中,实现了安全探索。
- 该框架发现的策略优于使用静态安全防护罩学习的策略,尤其在需要快速响应与精确控制的场景中表现更优。
- 在 obstacle2 和 acc(自适应巡航控制)环境中,Revel 的策略通过安全地缩小与前车的距离避免了碰撞,而 CPO 的策略则因减速延迟或不足而发生碰撞。
- 该方法通过依赖高效验证的符号防护罩,避免了重复的神经网络验证,从而在复杂领域中具备可扩展性。
- 实验结果表明,Revel 的动态防护机制允许更激进且高效的探索,同时保持最坏情况下的安全性。
- 理论分析证实了在神经符号策略空间中,基于镜面下降法的学习算法具有收敛性保证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。