Skip to main content
QUICK REVIEW

[论文解读] Safe Exploration in Markov Decision Processes with Time-Variant Safety using Spatio-Temporal Gaussian Process

Akifumi Wachi, Hiroshi Kajino|arXiv (Cornell University)|Sep 12, 2018
Gaussian Processes and Bayesian Inference参考文献 17被引用 4
一句话总结

本文提出 ST-SafeMDP,一种新颖的算法,用于在具有时变、先验未知安全约束的马尔可夫决策过程中的安全探索。该算法使用时空高斯过程建模动态演变的安全函数,并通过最小-最大优化问题来最大化最坏情况下的安全状态累计数量,从而在不确定、动态的环境(如月球地形)中确保安全并高效扩展安全区域。

ABSTRACT

In many real-world applications (e.g., planetary exploration, robot navigation), an autonomous agent must be able to explore a space with guaranteed safety. Most safe exploration algorithms in the field of reinforcement learning and robotics have been based on the assumption that the safety features are a priori known and time-invariant. This paper presents a learning algorithm called ST-SafeMDP for exploring Markov decision processes (MDPs) that is based on the assumption that the safety features are a priori unknown and time-variant. In this setting, the agent explores MDPs while constraining the probability of entering unsafe states defined by a safety function being below a threshold. The unknown and time-variant safety values are modeled using a spatio-temporal Gaussian process. However, there remains an issue that an agent may have no viable action in a shrinking true safe space. To address this issue, we formulate a problem maximizing the cumulative number of safe states in the worst case scenario with respect to future observations. The effectiveness of this approach was demonstrated in two simulation settings, including one using real lunar terrain data.

研究动机与目标

  • 解决安全约束先验未知且时变的环境中的安全探索问题,例如光照或地形条件变化的行星探测。
  • 克服现有安全强化学习方法的局限性,这些方法假设安全为时不变,可能导致智能体被困于不断缩小的安全区域。
  • 开发一种方法,在最坏未来观测下,以高概率保证安全的同时最大化安全区域的扩展。
  • 在通信延迟较长的安全关键应用(如月球巡视器)中实现自主、机载决策。
  • 通过同时优化召回率(扩展)和精确率(避免误报),平衡探索效率与安全性。

提出的方法

  • 使用复合核捕捉空间与时间相关性的时空高斯过程,建模时变的安全函数。
  • 利用高斯过程后验均值与方差预测未来安全值,结合不确定性定义预测安全空间。
  • 构建最小-最大优化问题,以考虑利普希茨连续性下安全函数值的下界,最大化最坏情况下的累计安全状态数。
  • 基于高斯过程均值与置信区间宽度的加权组合选择下一次探索目标,优先选择可能扩展安全区域的不确定状态。
  • 使用安全阈值 h 定义安全状态为满足 g(t, s) ≥ h 的状态,并确保所有动作均限制在预测安全空间内。
  • 通过 βt = 2 对所有 t 引入鲁棒性约束,并调整空间(ks, kŝ)与时间(kt, kt̂)核的长度尺度与方差,以反映环境动力学。

实验结果

研究问题

  • RQ1在具有时变、先验未知安全函数的环境中,安全探索算法能否维持安全保证?
  • RQ2当安全约束随时间演变时,智能体如何避免被困于不断缩小的安全区域?
  • RQ3对最坏未来观测的最小-最大公式在多大程度上能同时提升安全性和探索效率?
  • RQ4时空高斯过程能否在真实环境(如月球地形)中有效建模动态安全函数?
  • RQ5与基线方法相比,所提出的 ST-SafeMDP 算法在安全性(精确率)、效率(召回率)和故障率方面表现如何?

主要发现

  • 在 100 次蒙特卡洛运行的合成仿真中,ST-SafeMDP 在准确性、精确率、召回率和故障数方面均优于四种基线方法。
  • 与基线相比,该算法实现了更高的精确率(0.92)和召回率(0.85),表明具有强大的安全保证和有效的安全区域扩展能力。
  • 在月球地形仿真中,ST-SafeMDP 在保持高安全性(精确率 > 0.9)的同时实现了最高的召回率(0.85),证明了其高效且安全的探索能力。
  • 最小-最大公式有效防止了安全区域在最坏未来观测下意外缩小。
  • 时空高斯过程建模使对时变安全函数的预测更加准确,RMSE 已归一化至 1.0,ST-SafeMDP 的值低于不安全基线。
  • 视觉对比(图 5)表明,ST-SafeMDP 探索了最大安全区域,且不安全动作最少,优于时不变与不安全探索策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。