[论文解读] Scalable Synthesis of Verified Controllers in Deep Reinforcement Learning
本文通过将安全验证与神经网络训练解耦,提出了一种可扩展的深度强化学习控制器验证流水线。它通过概率可达性分析合成了一组经验证的线性控制器族(VLCF),该族在训练和部署期间作为基于时间的防护罩,实现了对具有高达800个维度的随机线性时不变和时变系统的安全、高维控制——相较于先前方法展现出显著的可扩展性优势。
There has been significant recent interest in devising verification techniques for learning-enabled controllers (LECs) that manage safety-critical systems. Given the opacity and lack of interpretability of the neural policies that govern the behavior of such controllers, many existing approaches enforce safety properties through shield, a dynamic monitoring-and-repairing mechanism that ensures a LEC does not emit actions that would violate desired safety conditions. These methods, however, have been shown to have significant scalability limitations because verification costs grow as problem dimensionality and objective complexity increase. In this paper, we propose a new automated verification pipeline capable of synthesizing high-quality safe controllers even when the problem domain involves hundreds of dimensions, or when the desired objective involves stochastic perturbations, liveness considerations, and other complex non-functional properties. Our key insight involves separating safety verification from neural controller training, and using pre-computed verified safety shields to constrain the training process. Experimental results over a range of high-dimensional benchmarks demonstrate the effectiveness of our approach in a range of stochastic linear time-invariant and time-variant systems.
研究动机与目标
- 解决现有验证技术在高维、随机且时变系统中学习型控制器(LECs)的可扩展性局限。
- 将安全验证与以性能为导向的神经网络训练解耦,实现安全属性的独立且可扩展的验证。
- 开发一种基于经验证线性控制器族(VLCF)的动态屏蔽机制,该机制基于时间步长而非空间状态运行。
- 将经验证的屏蔽机制集成到训练过程中,确保安全感知的策略学习,同时不损害性能。
- 为复杂高维信息物理系统(CPS)中的深度强化学习控制器提供可证明的安全保障。
提出的方法
- 该方法通过概率可达性分析验证一组线性控制器族,以确保在随机扰动下仍能保持安全。
- 基于时间的选取器每k步选择一个经验证的线性控制器,实现控制器的时序组合而非空间组合。
- 经验证的线性控制器族(VLCF)在训练和部署期间均作为动态防护罩运行,当神经策略可能产生不安全动作时进行干预。
- 神经网络控制器通过在防护罩监督下收集的安全转移数据缓冲(s_t, a_t, s_{t+1}, r_t)进行训练,确保学习过程中的安全性。
- 安全验证与神经网络的目标独立进行,从而实现与性能复杂度和维度的可扩展性。
- 该方法利用具有随机扰动的离散时间、线性时变系统,支持几乎必然可达性属性的正式验证。
实验结果
研究问题
- RQ1能否高效地为高维、随机、时变系统合成经验证的线性控制器族?
- RQ2与空间组合相比,每k步进行时序组合的经验证控制器是否在可扩展性和安全覆盖范围方面表现更优?
- RQ3能否在不牺牲正确性或性能的前提下,将安全验证与神经网络训练解耦?
- RQ4将经验证的屏蔽机制集成到训练循环中,相较于训练后屏蔽,能否显著提升最终控制器的质量与安全性?
- RQ5该流水线在超过800个状态维度的系统中能扩展到何种程度,是否突破了先前验证技术的限制?
主要发现
- 所提出的流水线成功验证了超过800个状态维度的系统,显著超越了以往工作的规模。
- 该方法在所有基准测试中均于一小时内完成控制器族的完整验证,而先前方法在相同时间限制内无法为高维情况返回可行解。
- 基于时间的控制器选择策略即使在空间组合至关重要的基准测试中也实现了有效的防护,展现出对各类系统类型的鲁棒性。
- 将VLCF集成到训练过程中,生成了质量更高、更安全的策略,其在安全性和性能方面均优于未经验证的对照组。
- 将安全验证与学习目标解耦,实现了与性能目标复杂度或神经网络架构复杂度无关的可扩展验证。
- 与先前基于屏蔽的方法相比,该方法在高维和随机场景下展现出更优的可扩展性,如Pendulum、Cartpole和Helicopter等基准测试中的合成时间对比所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。