Skip to main content
QUICK REVIEW

[論文レビュー] Safe Reinforcement Learning via Probabilistic Shields

Nils Jansen, Bettina Könighofer|arXiv (Cornell University)|Jul 16, 2018
Software Reliability and Analysis Research参考文献 57被引用数 16
ひとこと要約

本稿では、定義されたリスク閾値δを超える行動をブロックすることで、高い確率で安全を保証するための確率的シールドを、マルコフ決定過程(MDP)における強化学習(RL)に提案する。安全関連のMDP断片に対してモデルチェックを用いることで、事前に行動のリスクを評価し、探索をガイドすることで、未遮断RLに比べてエピソード数が桁違いに少なく、安全違反の回数も著しく少ない高速な学習を可能にする。

ABSTRACT

This paper targets the efficient construction of a safety shield for decision making in scenarios that incorporate uncertainty. Markov decision processes (MDPs) are prominent models to capture such planning problems. Reinforcement learning (RL) is a machine learning technique to determine near-optimal policies in MDPs that may be unknown prior to exploring the model. However, during exploration, RL is prone to induce behavior that is undesirable or not allowed in safety- or mission-critical contexts. We introduce the concept of a probabilistic shield that enables decision-making to adhere to safety constraints with high probability. In a separation of concerns, we employ formal verification to efficiently compute the probabilities of critical decisions within a safety-relevant fragment of the MDP. We use these results to realize a shield that is applied to an RL algorithm which then optimizes the actual performance objective. We discuss tradeoffs between sufficient progress in exploration of the environment and ensuring safety. In our experiments, we demonstrate on the arcade game PAC-MAN and on a case study involving service robots that the learning efficiency increases as the learning needs orders of magnitude fewer episodes.

研究の動機と目的

  • 安全な探索の課題を、安全を最優先とするシステムにおける強化学習(RL)の分野で解決すること。
  • 決定的制約ではなく確率的制約に基づく効率的な学習を可能にし、制御されたリスクを許容すること。
  • 安全な検証をポリシー学習から分離するため、簡略化された安全関連MDP上で形式的モデルチェックを実施すること。
  • 動的にリスク閾値δを調整することで、探索効率と安全性のバランスを取ること。
  • 遮断付きRLが、はるかに少ない訓練エピソード数で優れた性能と安全性を達成できることを示すこと。

提案手法

  • モデルベースRLを用いて、全MDPから安全に関連するMDP断片を構築し、重要な状態と遷移のみを捉える。
  • 確率的モデルチェック(Stormを用いて)により、各行動について有限時間内(例:10ステップ)に不安全状態に到達する確率を正確に計算する。
  • 安全確率が閾値δを超える行動をブロックするδシールドを定義し、状態ごとに適応的なδ値を設定する。
  • 推論時にシールドを適用し、Q学習エージェントが出力する行動をフィルタリングし、安全または低リスクの行動のみを許可する。
  • 大規模MDPに対応するため、部分的かつ独立的なモデルチェックとマルチスレーディングを用いてシールド構築を最適化する。
  • フォールバック動作を採用:δの下で安全な行動が存在しない場合、最適行動を許可することでポリシーの崩壊を防ぐ。

実験結果

リサーチクエスチョン

  • RQ1モデルチェックに基づく確率的シールドは、高い確率での安全を保証しながら、RLにおける学習効率を向上させることができるか?
  • RQ2δの選択が、安全性と探索効率のトレードオフにどのように影響するか?
  • RQ3遮断により、安全を最優先とする環境で有効なポリシーを学習するのに必要なエピソード数をどの程度削減できるか?
  • RQ4抽象化と並列処理を用いた場合に、大規模MDPに適用した際のシールド構築プロセスのスケーラビリティはどの程度か?
  • RQ5PAC-MAN や倉庫ロボティクスの実世界のシナリオにおいて、遮断付きRLは未遮断RLを上回る性能と安全性を達成できるか?

主な発見

  • PAC-MANでは、遮断付きRLが顕著に高い平均スコア(例:4ゴーストの27x25グリッドでは339.89対-129.25)を達成し、勝率も向上(小規模なインスタンスでは0.84対0.04)。
  • 倉庫ロボットの事例では、8つの意思決定状態を遮断することで、勝率が0.16から0.71に上昇し、平均スコアが-186から420に上昇した。
  • 安全違反による失敗エピソードが著しく減少したため、有効なポリシーを学習するのに必要なエピソード数が桁違いに減少した。
  • 最大約10^6状態のMDPに対し、シールド構築に最長6時間(シングルスレッド)を要したが、部分的かつ並列的構築によりスケーラブルであった。
  • 最適ポリシーが高リスクに導く可能性があるにもかかわらず、致命的な行動(例:ゴーストとの衝突)を効果的に防止し、耐障害性と学習の安定性が向上した。
  • 適応的δメカニズムにより、安全性の許容度を動的に調整でき、確率的安全保証を維持しながら探索を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。