Skip to main content
QUICK REVIEW

[論文レビュー] Robust Model Predictive Shielding for Safe Reinforcement Learning with Stochastic Dynamics

Shuo Li, Osbert Bastani|arXiv (Cornell University)|Oct 24, 2019
Model Reduction and Neural Networks参考文献 35被引用数 7
ひとこと要約

本稿では、確率的非線形システムにおける強化学習の安全確保を図るため、チューブベースのロバスト非線形モデル予測制御(NMPC)をバックアップとして用いるフレームワーク、Robust Model Predictive Shielding(RMPS)を提案する。サンプルされた軌道と統計的学習理論を活用することで、到達可能集合に対する高確率保証を提供し、カート・ポールやランダム障害物を伴う非ホロノミック系のような環境でも安全かつ高性能な制御を実現する。

ABSTRACT

This paper proposes a framework for safe reinforcement learning that can handle stochastic nonlinear dynamical systems. We focus on the setting where the nominal dynamics are known, and are subject to additive stochastic disturbances with known distribution. Our goal is to ensure the safety of a control policy trained using reinforcement learning, e.g., in a simulated environment. We build on the idea of model predictive shielding (MPS), where a backup controller is used to override the learned policy as needed to ensure safety. The key challenge is how to compute a backup policy in the context of stochastic dynamics. We propose to use a tube-based robust NMPC controller as the backup controller. We estimate the tubes using sampled trajectories, leveraging ideas from statistical learning theory to obtain high-probability guarantees. We empirically demonstrate that our approach can ensure safety in stochastic systems, including cart-pole and a non-holonomic particle with random obstacles.

研究の動機と目的

  • 動的システムのダイナミクスが既知であるが、加法的確率的摂動を受ける非線形確率的システムにおける強化学習方策の安全確保という課題に取り組む。
  • 従来のシャーディング手法が決定論的ダイナミクスや線形システムを仮定しているため、複雑なロボット工学的タスクへの適用が制限されているという問題を克服する。
  • 高次元で非線形的かつ確率的な制御環境における安全確保を、スケーラブルかつ理論的裏付けのある方法で開発する。
  • 必要に応じて、保証された安全なバックアップ制御器によって動的に上書きすることで、ブラックボックス型ディープ強化学習方策の安全な導入を可能にする。
  • 統計的学習理論を用いて、サンプル有限の状況下でバックアップ制御器の到達可能集合のサイズに対する確率的保証を提供する。

提案手法

  • 確率的摂動に対処し、非線形システムにおける安全確保を実現するため、チューブベースのロバストNMPCをバックアップ制御器として採用する。
  • 確率的ダイナミクスからの軌道のサンプリングにより、バックアップ制御器の前方到達可能集合を推定する。
  • 統計的学習理論(例:VC次元の境界)を適用し、名目軌道の周囲の推定チューブのサイズに対する高確率信頼区間を導出する。
  • 推定されたチューブをモデル予測シャーディング(MPS)フレームワークと統合し、学習済み方策が安全に実行可能かどうかを動的にチェックする。
  • 各時刻において、現在の状態が推定された安全なチューブ内にあるかどうかを判定する;もしそうでなければ、バックアップNMPC制御器を起動する。
  • 確率的ロバスト回復可能性条件を用いて、方策が逸脱した場合でも、高い確率で安全領域にシステムを戻せるように保証する。

実験結果

リサーチクエスチョン

  • RQ1理論的安全保証を維持したまま、シャーディングフレームワークを確率的非線形システムに拡張することは可能か?
  • RQ2確率的摂動が存在する状況下で、ロバストNMPC制御器の到達可能集合に対するサンプル有限の確率的保証をどのように確立できるか?
  • RQ3安全強化学習において、ダイナミクスの非線形性を考慮することで、線形近似と比較してどれほど保守的(過剰な制御)が軽減されるか?
  • RQ4チューブ推定にサンプリングベースのアプローチを用いることで、高次元システムにおいても計算的実行可能性と強固な理論的保証を両立できるか?
  • RQ5確率的環境下で、ロバストNMPCバックアップと線形MPCバックアップを用いた場合に、学習済み方策の性能にどのような差が生じるか?

主な発見

  • RMPSは、カート・ポールやランダム障害物を伴う非ホロノミック粒子のような確率的非線形システムにおいて、高確率の安全保証を達成する。
  • 実験では、線形ロバストMPC(LRMPS)と比較して、保守的でないことが示され、バックアップ制御器の起動回数が少ないことから、方策の性能が向上している。
  • カート・ポール環境では、RMPSはLRMPSよりも多くの初期状態 $(\theta, \omega)$ でポールの安定化に成功しており、より優れたロバスト性と性能を示している。
  • 理論的解析により、システムが高確率で $1 - (T+1)\epsilon$ のロバスト回復性を保つことが示された。ここで $\epsilon$ は統計的学習境界から導出される。
  • サンプリングベースのチューブ推定手法により、到達可能集合に対する有限サンプルの確率的保証が得られ、実用的導入に理論的裏付けを提供する。
  • 実験的結果により、RMPSは安全を確保しながら高い性能を維持しており、カバー範囲とバックアップ使用頻度の両面でLRMPSを上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。