Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Synthesis of Verified Controllers in Deep Reinforcement Learning

Zikang Xiong, Suresh Jagannathan|arXiv (Cornell University)|Apr 20, 2021
Adversarial Robustness in Machine Learning参考文献 32被引用数 7
ひとこと要約

本稿では、安全性の検証をニューラルネットワークの学習とは分離することで、深層強化学習コントローラー向けにスケーラブルな検証パイプラインを提案する。確率的到達可能性解析を用いて検証済みの線形コントローラー群(VLCF)を合成し、訓練時および実行時における時間的シャッターとして機能させることで、確率的線形時不変および時変システムにおいて、最大800次元の高次元で安全な制御を実現する。従来手法に比べて顕著なスケーラビリティを示している。

ABSTRACT

There has been significant recent interest in devising verification techniques for learning-enabled controllers (LECs) that manage safety-critical systems. Given the opacity and lack of interpretability of the neural policies that govern the behavior of such controllers, many existing approaches enforce safety properties through shield, a dynamic monitoring-and-repairing mechanism that ensures a LEC does not emit actions that would violate desired safety conditions. These methods, however, have been shown to have significant scalability limitations because verification costs grow as problem dimensionality and objective complexity increase. In this paper, we propose a new automated verification pipeline capable of synthesizing high-quality safe controllers even when the problem domain involves hundreds of dimensions, or when the desired objective involves stochastic perturbations, liveness considerations, and other complex non-functional properties. Our key insight involves separating safety verification from neural controller training, and using pre-computed verified safety shields to constrain the training process. Experimental results over a range of high-dimensional benchmarks demonstrate the effectiveness of our approach in a range of stochastic linear time-invariant and time-variant systems.

研究の動機と目的

  • 高次元で確率的かつ時変なシステムにおける学習型コントローラー(LEC)の検証手法のスケーラビリティ制限を解決すること。
  • 安全性の検証をパフォーマンス指向のニューラルネットワーク学習とは分離し、安全性の性質に対する独立的かつスケーラブルな検証を可能にすること。
  • 空間的状態ではなく時間ステップに基づく動的シャッターメカニズムを、検証済みの線形コントローラー群(VLCF)に基づき開発すること。
  • 検証済みのシャッターを学習プロセスに統合し、性能に影響を与えることなく安全を意識したポリシー学習を可能にすること。
  • 複雑な高次元のサイバーフィジカルシステム(CPS)における深層強化学習コントローラーに対して、証明可能な安全性保証を達成すること。

提案手法

  • 確率的到達可能性解析により検証された線形コントローラー群を構築し、確率的摂動下でも安全性を保証する。
  • 時間的選択子が毎kステップごとに検証済みの線形コントローラーを選択し、空間的合成ではなく時間的合成を実現する。
  • 検証済みの線形コントローラー群(VLCF)は、訓練時および実行時において動的シャッターとして機能し、ニューラルポリシーが安全でない行動をとる場合に干渉する。
  • ニューラルネットワークコントローラーは、シャッターの監視下で収集された安全な遷移バッファ(s_t, a_t, s_{t+1}, r_t)を用いて学習され、学習中の安全性が保証される。
  • 安全性の検証はニューラルネットワークの目的関数とは独立に実施され、パフォーマンスの複雑さや次元数に対してスケーラブルである。
  • 離散時間、線形、時変なシステムに確率的摂動を適用し、ほぼ確実な到達可能性特性の形式的検証を可能にする。

実験結果

リサーチクエスチョン

  • RQ1高次元で確率的かつ時変なシステムに対して、検証済みの線形コントローラー群を効率的に合成できるか?
  • RQ2時間的合成(毎kステップ)は、空間的合成に比べてスケーラビリティおよび安全性カバレッジの面で優れているか?
  • RQ3安全性の検証をニューラルネットワークの学習とは分離しても、正しさやパフォーマンスを損なわずに可能か?
  • RQ4訓練ループに検証済みのシャッターを統合することで、訓練後処理によるシャッターと比較して、最終的なコントローラーの品質と安全性が向上するか?
  • RQ5このパイプラインは、800次元を超える状態変数を持つシステムに、従来の検証手法の限界を超えてスケーリングできるか?

主な発見

  • 提案されたパイプラインは、800次元を超える状態変数を持つシステムにおいてもコントローラーの検証に成功し、従来の研究を著しく上回る規模を達成した。
  • すべてのベンチマークで、1時間以内にコントローラー群の完全な検証を達成したが、従来の手法は高次元ケースにおいて同じ時間制限内に妥当な解を返せなかった。
  • 時間ベースのコントローラー選択戦略により、空間的合成が重要となるベンチマークでも効果的なシャッタリングが実現され、さまざまなシステムタイプにわたる頑健性を示した。
  • VLCFを訓練プロセスに統合した結果、安全性とパフォーマンスの両面で非検証対象のものよりも優れた品質のポリシーが得られ、安全性が向上した。
  • 安全性の検証を学習目的から分離することで、パフォーマンス目的の複雑さやニューラルネットワークアーキテクチャの複雑さに依存しないスケーラブルな検証が可能になった。
  • Pendulum, Cartpole, Helicopter などのベンチマークにおける合成時間の比較から、特に高次元および確率的状況下で、従来のシャッターベース手法に比べて優れたスケーラビリティを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。