Skip to main content
QUICK REVIEW

[论文解读] A Learnable Safety Measure

Steve Heim, Alexander von Rohr|arXiv (Cornell University)|Oct 7, 2019
Gaussian Processes and Bayesian Inference参考文献 26被引用 4
一句话总结

该论文提出了一种可学习的安全措施,隐式捕捉系统相对于失效状态的动力学特性,通过高斯过程主动采样实现无模型的安全探索。该方法学习可行状态-动作对的概率估计,在500次采样后将故障率降低了8%,且无需精确的系统模型或对失效边界的先验知识。

ABSTRACT

Failures are challenging for learning to control physical systems since they risk damage, time-consuming resets, and often provide little gradient information. Adding safety constraints to exploration typically requires a lot of prior knowledge and domain expertise. We present a safety measure which implicitly captures how the system dynamics relate to a set of failure states. Not only can this measure be used as a safety function, but also to directly compute the set of safe state-action pairs. Further, we show a model-free approach to learn this measure by active sampling using Gaussian processes. While safety can only be guaranteed after learning the safety measure, we show that failures can already be greatly reduced by using the estimated measure during learning.

研究动机与目标

  • 开发一种安全措施,隐式编码系统相对于失效状态的动力学特性,而无需显式计算可行核。
  • 在故障代价高昂但非致命的物理系统中实现安全探索,尤其适用于缺乏精确动力学模型的情况。
  • 利用高斯过程的主动采样学习可行状态-动作集的概率估计,最大限度减少对先验知识的依赖。
  • 通过使用估计的安全措施作为指导,在收敛前即降低学习过程中的故障率。
  • 提供一种可扩展的无模型替代方案,替代传统可行核计算,避免高工程成本和模型不准确性。

提出的方法

  • 安全措施定义为可行度在可行状态-动作对集合上的积分,量化了避免进入失效状态的‘操作余地’。
  • 使用高斯过程对安全措施进行建模,其先验基于低精度仿真和已知的工作点,以提高收敛速度。
  • 主动采样根据不确定性和改善安全估计的潜力选择新的状态-动作对,使用置信区间 γ_opt 和 γ_caut。
  • 该算法通过避免不可行状态并尊重高斯过程的光滑性假设,迭代地优化安全措施并识别可行集。
  • 该方法采用状态-动作空间的可行度表述,若系统能从该点无限期避免失效,则认为该状态-动作对是可行的。
  • 通过优先选择能降低高风险区域不确定性的样本,同时最小化故障发生次数,实现探索与安全的平衡。

实验结果

研究问题

  • RQ1能否直接从数据中学习安全措施,而无需精确的系统动力学模型?
  • RQ2如何利用基于高斯过程的无模型方法在故障代价高昂的系统中实现安全探索?
  • RQ3在收敛前,估计的安全措施在多大程度上能降低故障率?
  • RQ4调优参数如 γ_opt、γ_caut 和 λ 如何影响所学可行集的准确性和保守性?
  • RQ5高斯过程的光滑性假设在非光滑失效边界附近如何影响学习性能?

主要发现

  • 所提出的安全部分有效捕捉了系统的可行性,通过量化每个状态-动作对可采取的安全动作数量。
  • 在500次采样后,该方法在SLIP模型中实现了8%的故障率,显著降低了学习过程中的故障发生。
  • 即使在非光滑失效边界附近,该算法也成功学习了可行集,尽管这些区域因违反光滑性假设而需要更多采样。
  • 基于低精度仿真推导的先验协方差函数虽存在模型不准确性,但通过结合合理选择的工作点,仍实现了更快收敛。
  • 该方法实现了保守但近乎最大的可行集近似,表现出对先验不准确性的鲁棒性,并有效利用了主动采样。
  • 该方法在传统基于模型的可行核计算不可行的复杂高维系统中,实现了安全学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。