Skip to main content
QUICK REVIEW

[論文レビュー] Safe Reinforcement Learning Using Robust Action Governor

Yutong Li, Nan Li|arXiv (Cornell University)|Feb 21, 2021
Reinforcement Learning in Robotics参考文献 19被引用数 9
ひとこと要約

本稿では、任意の強化学習(RL)アルゴリズムと統合可能な安全な強化学習フレームワークを提案する。このフレームワークは、リアルタイムでモデルに基づく制約の強制を実現するロバストアクションガバナーライク(RAG)を用い、学習中の安全性を保証する。集合論的技術と最適化を用いて制御信号をオンラインで修正することで、RAGは制約違反を完全に回避する。実装例として、100%の制約満足度を達成したアダプティブクルーズコントロールの実験により、従来のRLに比べて高速かつ安定した学習が実現された。

ABSTRACT

Reinforcement Learning (RL) is essentially a trial-and-error learning procedure which may cause unsafe behavior during the exploration-and-exploitation process. This hinders the application of RL to real-world control problems, especially to those for safety-critical systems. In this paper, we introduce a framework for safe RL that is based on integration of a RL algorithm with an add-on safety supervision module, called the Robust Action Governor (RAG), which exploits set-theoretic techniques and online optimization to manage safety-related requirements during learning. We illustrate this proposed safe RL framework through an application to automotive adaptive cruise control.

研究の動機と目的

  • モデルフリー強化学習における探索段階での不安全行動のリスクを解消すること。特に、安全が求められる制御システムにおいて。
  • 試行錯誤に依存せずに、学習時および運用時における制約の満足を保証するフレームワークの開発。
  • 市販の任意のRLアルゴリズムとモデルベースの安全監視器を統合することで、安全で高性能なポリシー学習を実現すること。
  • 既存のアクションガバナー理論を、境界付きの摂動と非凸制約を有する離散時間線形システムに拡張すること。
  • 実世界の自動車制御応用—アダプティブクルーズコントロールにおいて、フレームワークの有効性を実証すること。

提案手法

  • フレームワークは、名目上のRLポリシーと、追加の安全監視器として機能するロバストアクションガバナー(RAG)を統合する。
  • RAGは、システムのダイナミクスと制約に基づき、事前計算された安全領域と非安全領域を集合論的技術を用いて算出する。
  • 各時刻において、RAGはRLポリシー出力の最小限の修正を実現するため、オンラインで混合整数二次計画問題(MIQP)を解く。
  • 本手法は離散時間システムに直接定式化されており、連続時間バリア関数手法で一般的に生じる離散化誤差を回避する。
  • RAGは制御入力を処理するため、参照ガバナーとは異なり、上位レベルの安定化制御系を必要としない。
  • 安全領域は事前計算でMPT3ツールボックスを用い、オンライン最適化はOPTIを介してSCIPでリアルタイムに解く。

実験結果

リサーチクエスチョン

  • RQ1モデルフリーRLアルゴリズムとモデルベースの安全監視器を効果的に統合することで、探索段階における安全性を確保できるか?
  • RQ2RAGベースのフレームワークは、従来のRLと比較して、学習中の制約違反率にどの程度差が現れるか?
  • RQ3オンラインRAG最適化の計算オーバーヘッドはどの程度で、リアルタイム制御応用に実用的か?
  • RQ4非凸かつ境界付き摂動環境下でも、RAGフレームワークは安全性を保ちながら性能を維持できるか?
  • RQ5RAGは探索領域を安全で明確に定義された領域に制限することで、より高速かつ安定した学習を可能にするか?

主な発見

  • RAGを用いた安全なRLフレームワークは、学習全期間を通じて制約違反がゼロであったのに対し、従来のRLでは初期段階で高い違反率を示した。
  • RAG最適化問題を解くための平均的なオンライン計算時間は、1時刻あたり約30 msであり、リアルタイム制御に実用可能であることが確認された。
  • 1エピソードあたりの学習時間は平均130秒であり、オンライン最適化の影響で従来のRLより長くなったが、シミュレーションベースの学習には依然として妥当な範囲であった。
  • 安全なRLポリシーは、20回の実験における平均報酬の標準偏差が低く抑えられており、従来のRLに比べて収束が早く、報酬のばらつきも少なかった。
  • RAGは、安全範囲[1, 2]秒の車間距離を維持し、一貫した安全な車両追従行動を実現した。
  • 検証結果から、RAGが制御入力を効果的に監視・補正し、動的走行条件下でも不安全な相対距離を防止していたことが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。