Skip to main content
QUICK REVIEW

[论文解读] Safe Reinforcement Learning Using Robust Action Governor

Yutong Li, Nan Li|arXiv (Cornell University)|Feb 21, 2021
Reinforcement Learning in Robotics参考文献 19被引用 9
一句话总结

本文提出了一种安全强化学习框架,将鲁棒动作调节器(RAG)与任意强化学习(RL)算法结合,通过基于模型的实时约束强制执行,确保训练过程中的安全性。通过使用集合论技术和优化方法在线修改控制信号,RAG 确保不会发生任何约束违反——在自适应巡航控制中实现了100%的约束满足率,并且相比传统RL,学习速度更快、更稳定。

ABSTRACT

Reinforcement Learning (RL) is essentially a trial-and-error learning procedure which may cause unsafe behavior during the exploration-and-exploitation process. This hinders the application of RL to real-world control problems, especially to those for safety-critical systems. In this paper, we introduce a framework for safe RL that is based on integration of a RL algorithm with an add-on safety supervision module, called the Robust Action Governor (RAG), which exploits set-theoretic techniques and online optimization to manage safety-related requirements during learning. We illustrate this proposed safe RL framework through an application to automotive adaptive cruise control.

研究动机与目标

  • 为解决模型无关强化学习中探索过程固有的不安全行为风险,特别是在安全关键系统中。
  • 开发一种框架,确保在训练和部署过程中均满足约束条件,而无需依赖试错法。
  • 通过将基于模型的安全监督器与任意现成的强化学习算法集成,实现在安全前提下的高性能策略学习。
  • 将现有动作调节器理论扩展至处理具有有界扰动和非凸约束的离散时间线性系统。
  • 在真实世界的汽车控制应用——自适应巡航控制中,验证该框架的有效性。

提出的方法

  • 该框架将名义RL策略与作为附加安全监督器的鲁棒动作调节器(RAG)相结合。
  • RAG 基于系统动态和约束,使用集合论技术离线计算安全集和非安全集。
  • 在每个时间步,RAG 求解一个在线混合整数二次规划(MIQP),以最小程度地修改RL策略输出,确保状态可行性。
  • 该方法直接针对离散时间系统进行公式化,避免了连续时间屏障函数方法中常见的离散化误差。
  • RAG 作用于控制器输出,使其可应用于更底层的控制回路,而参考调节器则需要一个已稳定的高层控制器。
  • 安全集通过 MPT3 工具箱离线计算,在线优化则通过 OPTI 使用 SCIP 实现实时求解。

实验结果

研究问题

  • RQ1能否有效将基于模型的安全监督器与模型无关的强化学习算法集成,以确保探索过程中的安全性?
  • RQ2与传统RL相比,基于RAG的框架在训练过程中的约束违反率如何?
  • RQ3在线RAG优化的计算开销是多少?是否适用于实时控制应用?
  • RQ4在非凸且有界扰动环境下,RAG框架能否在保证安全的同时维持性能?
  • RQ5RAG是否通过将探索限制在安全且明确定义的区域,实现了更快、更稳定的学习?

主要发现

  • 采用RAG的安全强化学习框架在整个训练过程中实现了零约束违反,而传统RL则表现出较高的初始违反率。
  • 求解RAG优化问题的平均在线计算时间为每个时间步约30毫秒,证实其适用于实时控制。
  • 每集训练的平均时长为130秒,由于在线优化的存在,比传统RL更长,但仍适用于基于仿真的学习。
  • 与传统RL相比,安全强化学习策略实现了更快的收敛速度和更低的奖励方差,如20次实验中平均奖励标准差的降低所示。
  • RAG将车头时距始终维持在[1, 2]秒的安全范围内,确保了稳定的车辆跟驰行为。
  • 验证结果表明,RAG有效监控并纠正了控制输入,即使在动态驾驶条件下也能防止不安全的相对距离。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。