Skip to main content
QUICK REVIEW

[論文レビュー] Shielded Reinforcement Learning for Hybrid Systems

Asger Horn Brorholt, Peter Gjøl Jensen|arXiv (Cornell University)|Aug 28, 2023
Adversarial Robustness in Machine LearningComputer Science参考文献 47被引用数 3
ひとこと要約

本稿では、2人零和安全ゲームを近似するために体系的サンプリングを用いるシミュレーションベースの手法を提案し、ハイブリッドマルコフ決定過程(HMDP)の安全シールドを合成することで、統計的に安全かつ近似的最適な強化学習を実現する。この手法は報酬形状付けやポストシールド化を上回り、産業界の事例において、事前シールド化が優れた性能と安全保証を達成する。

ABSTRACT

Safe and optimal controller synthesis for switched-controlled hybrid systems, which combine differential equations and discrete changes of the system's state, is known to be intricately hard. Reinforcement learning has been leveraged to construct near-optimal controllers, but their behavior is not guaranteed to be safe, even when it is encouraged by reward engineering. One way of imposing safety to a learned controller is to use a shield, which is correct by design. However, obtaining a shield for non-linear and hybrid environments is itself intractable. In this paper, we propose the construction of a shield using the so-called barbaric method, where an approximate finite representation of an underlying partition-based two-player safety game is extracted via systematically picked samples of the true transition function. While hard safety guarantees are out of reach, we experimentally demonstrate strong statistical safety guarantees with a prototype implementation and UPPAAL STRATEGO. Furthermore, we study the impact of the synthesized shield when applied as either a pre-shield (applied before learning a controller) or a post-shield (only applied after learning a controller). We experimentally demonstrate superiority of the pre-shielding approach. We apply our technique on a range of case studies, including two industrial examples, and further study post-optimization of the post-shielding approach.

研究の動機と目的

  • 連続的および離散的ダイナミクスを有する複雑なハイブリッドシステムに対して、安全かつ最適な制御則を合成する課題に対処する。
  • 非線形およびハイブリッド環境における正確なシールド合成の非実行可能性を克服し、サンプリングによる遷移関係の近似を用いる。
  • 『ババリアン・メソッド』を模倣することでスケーラブルな抽象化を実現し、実用的で統計的に安全なシールドを効率的に構築できるようにする。
  • 事前シールド化とポストシールド化の戦略を比較し、制御則の最適性および安全性に与える影響を評価する。
  • 実世界の産業界の事例を用いて本手法の堅牢性とスケーラビリティを検証する。

提案手法

  • 連続的ハイブリッドシステムの離散的抽象表現を生成するため、状態空間の有限分割を構築する。
  • システム軌道の体系的サンプリングによりHMDPの真の遷移関数を近似し、スケーラビリティを確保する『ババリアン・メソッド』を模倣する。
  • 抽象化されたシステムを、制御則(プレイヤー1)と環境(プレイヤー2)の2人零和安全ゲームとしてモデル化し、安全でない状態を避けることを目的とする。
  • Uppaal Strategoを用いて2人零和安全ゲームを解き、不適切な行動のみを制限する「最も許容的な」シールド戦略を合成する。
  • シールドを学習の前段階(事前シールド化)またはデプロイメント中(ポストシールド化)に統合し、コストと干渉最小化による最適化を実施する。
  • 実世界のモデル、特にDC-DCブーストコンバータとオイルポンプを用いて、安全保証と性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1シンボリック計算が非現実的であるハイブリッド・マルコフ決定過程において、実用的でスケーラブルなシールド合成手法を開発できるか?
  • RQ2ハイブリッドシステムの強化学習において、事前シールド化はポストシールド化よりも優れた制御則性能と低い干渉頻度を達成するか?
  • RQ3正確な到達可能性解析を伴わずに、システム遷移の体系的サンプリングが統計的に安全なシールドをどの程度提供できるか?
  • RQ4報酬形状付けとシールドベースの安全保証の安全性保証および性能の観点から、どちらが優れているか?
  • RQ5ポストシールド化は干渉を低減するために最適化可能か?また、事前シールド化と比較してその性能はいかがなものか?

主な発見

  • 事前シールド化は一貫してポストシールド化を上回り、クルーズコントロールモデルではコスト6912を達成し、最良の最適化後ポストシールド化と比較して39.2%低い。
  • 干渉最小化最適化により、ポストシールド化のシールド干渉回数を15.3%削減可能だが、コストは3.7%上昇する。
  • コスト最小化のための最適化によりコストは5.3%削減されるが、干渉回数は29.1%増加し、性能と安全保証のトレードオフが顕在化する。
  • 報酬ペナルティを最大1000まで設定しても、安全違反が依然として発生するため、報酬形状付けでは最悪ケースの安全保証が不十分であることが示された。
  • 本手法は、2つの産業界事例を含むすべての事例で強力な統計的安定性を達成し、信頼性のあるシールド化に必要なサンプル数(n=4)は中程度にとどまる。
  • シンボリック手法よりもシールド合成プロセスが著しく高速であり、複雑なハイブリッドシステムへの実用的デプロイメントを可能にする。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。