[论文解读] Sim-to-Lab-to-Real: Safe Reinforcement Learning with Shielding and Generalization Guarantees
本文提出 Sim-to-Lab-to-Real 框架,一种用于安全强化学习的方法,结合哈密顿-雅可比可达性分析与 PAC-Bayes 泛化保证,确保在真实世界部署中的安全性和性能。该方法采用双策略设置,包含一个性能策略与一个具备安全意识的备用策略,实现在仿真与实验室环境中的安全探索,并为未见过的真实环境提供安全性和泛化的概率证书。
Safety is a critical component of autonomous systems and remains a challenge for learning-based policies to be utilized in the real world. In particular, policies learned using reinforcement learning often fail to generalize to novel environments due to unsafe behavior. In this paper, we propose Sim-to-Lab-to-Real to bridge the reality gap with a probabilistically guaranteed safety-aware policy distribution. To improve safety, we apply a dual policy setup where a performance policy is trained using the cumulative task reward and a backup (safety) policy is trained by solving the Safety Bellman Equation based on Hamilton-Jacobi (HJ) reachability analysis. In Sim-to-Lab transfer, we apply a supervisory control scheme to shield unsafe actions during exploration; in Lab-to-Real transfer, we leverage the Probably Approximately Correct (PAC)-Bayes framework to provide lower bounds on the expected performance and safety of policies in unseen environments. Additionally, inheriting from the HJ reachability analysis, the bound accounts for the expectation over the worst-case safety in each environment. We empirically study the proposed framework for ego-vision navigation in two types of indoor environments with varying degrees of photorealism. We also demonstrate strong generalization performance through hardware experiments in real indoor spaces with a quadrupedal robot. See https://sites.google.com/princeton.edu/sim-to-lab-to-real for supplementary material.
研究动机与目标
- 通过引入受控的中间‘实验室’训练阶段,解决模拟到真实强化学习中的现实差距问题。
- 通过整合基于 HJ 可达性分析导出的备用安全策略,在训练和部署过程中确保安全性。
- 利用 PAC-Bayes 理论,为未见真实环境中的策略性能与安全性提供概率性、分布无关的保证。
- 通过屏蔽与统计边界相结合的方式,弥合仿真与真实世界部署之间的差距,实现泛化性认证。
- 实现在家庭中有儿童或动态室内空间等安全关键环境中的 RL 策略可靠部署。
提出的方法
- 在仿真环境中训练双策略系统:一个针对任务奖励进行优化的性能策略,以及一个通过 HJ 可达性分析使用安全贝尔曼方程训练的备用安全策略。
- 在实验室阶段应用监督控制方案(屏蔽机制),当安全评论值超过阈值时,覆盖性能策略的不安全动作。
- 利用 PAC-Bayes 框架推导出在最坏环境变化情况下的期望性能与安全性下界。
- 通过条件化策略在潜在变量分布上,实现在从仿真到实验室迁移过程中的多样化环境泛化能力。
- 在实验室阶段使用镜像真实世界视觉保真度与动力学特性的高保真仿真环境对策略分布进行微调。
- 通过系统辨识方法建模真实机器人动力学与摄像头位姿,确保实验室训练的保真度,并实现向真实部署的泛化。
实验结果
研究问题
- RQ1具备屏蔽机制的双策略框架是否能在不损害性能的前提下,确保在仿真到实验室训练过程中的安全探索?
- RQ2如何将 PAC-Bayes 泛化边界应用于为未见真实环境中的安全性与性能提供概率性保证?
- RQ3与标准的仿真到真实方法相比,该框架在真实世界部署过程中在多大程度上减少了安全违规?
- RQ4潜在变量分布的选择及其多样性在多大程度上影响泛化性能与安全性鲁棒性?
- RQ5即使在实验室与真实环境之间存在微小分布偏移的情况下,该框架是否仍能提供可认证的安全性与性能保证?
主要发现
- 通过备用策略的有效屏蔽,即使在高多样性环境中,该框架也能显著减少训练过程中的安全违规。
- 在足够多的潜在多样性(例如 β=2)下,策略分布能良好泛化至未见过的测试环境,同时保持安全性。
- 在真实室内空间中对四足机器人进行的硬件实验表明,该方法展现出强大的泛化与安全性表现,验证了理论保证。
- PAC-Bayes 边界为期望性能与安全性提供了紧密的概率保证下界,即使在最坏环境期望条件下依然有效。
- 该方法对环境分布偏移表现出鲁棒性,理论保证在环境建模的现实假设下依然成立。
- 该框架实现了在安全关键真实世界场景中 RL 策略的部署,具备经实证验证的可认证性能与安全性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。