Skip to main content
QUICK REVIEW

[論文レビュー] Safety-Constrained Reinforcement Learning for MDPs

Sebastian Junges, Nils Jansen|arXiv (Cornell University)|Oct 20, 2015
Formal Methods in Verification参考文献 15被引用数 6
ひとこと要約

本稿では、安全制約を満たしながら探索を保証する反復的強化学習フレームワークを、マーカフ決定過程(MDPs)に対して提案する。まず安全で許容性の高いスケジューラを計算し、その後SMTに基づく最適化とQ学習を用いて改善する。この手法により、安全制約が満たされつつ、コスト最適性が反復的に向上し、期待コストのタイトな境界を伴う実用的ベンチマークにおいてグローバル最適な方策を達成する。

ABSTRACT

We consider controller synthesis for stochastic and partially unknown environments in which safety is essential. Specifically, we abstract the problem as a Markov decision process in which the expected performance is measured using a cost function that is unknown prior to run-time exploration of the state space. Standard learning approaches synthesize cost-optimal strategies without guaranteeing safety properties. To remedy this, we first compute safe, permissive strategies. Then, exploration is constrained to these strategies and thereby meets the imposed safety requirements. Exploiting an iterative learning procedure, the resulting policy is safety-constrained and optimal. We show correctness and completeness of the method and discuss the use of several heuristics to increase its scalability. Finally, we demonstrate the applicability by means of a prototype implementation.

研究の動機と目的

  • コストが事前に未知であり、安全性が重要なMDPsにおける最適制御則の合成という課題に対処すること。
  • 実行時における強化学習の探索が、安全制約に違反しないように保証すること。
  • 1つの状態に対して複数の安全な行動を許容する安全で許容性の高いスケジューラを計算し、安全制約内での幅広い探索を可能にすること。
  • SMTソルバとQ学習を用いた反復的改善により、グローバル最適なコストパフォーマンスに収束すること。
  • 確率的環境と未知のコスト関数を伴う実世界のベンチマークにおいて、スケーラビリティと正しさを実証すること。

提案手法

  • 安全で許容性の高いスケジューラをSMTソルバを用いて計算し、安全制約に違反しないすべての行動を符号化する(例:確率的到達可能性とλの境界を伴う)。
  • MDPの行動空間を許容性スケジューラが許可する行動に制限することで、すべての探索が安全に保証される。
  • 制限されたMDP上でQ学習を適用し、未知のコスト関数に関して局所最適な方策を学習する。
  • 各学習反復後、学習済み方策を将来の許容性スケジューラ計算から明示的に除外することで、代替の安全な戦略を探索する。
  • 混合整数線形計画法(MILP)を用いて、許容性スケジューラを効率的に符号化・解く。
  • 期待コストの下限と上限を維持する;上限と下限が収束した場合、または既知の下限を用いてグローバル最適性が証明された場合に終了する。

実験結果

リサーチクエスチョン

  • RQ1安全なすべての行動を含みつつ、計算的に扱いやすい許容性スケジューラを計算可能か?
  • RQ2コストが実行前に未知である場合、強化学習の探索が実行時においても安全であることをどのように保証できるか?
  • RQ3コスト知識が不完全な状況下でも、グローバル最適な安全方策に収束するための反復的戦略は何か?
  • RQ4SMTソルバとMILPをどのように組み合わせて、安全制約下での許容性スケジューラを効率的に計算できるか?
  • RQ5スケジューラ空間におけるヒューリスティックガイドドサーチにより、許容性とスケーラビリティをどの程度向上できるか?

主な発見

  • 本手法は、移動する掃除屋と通信制約を伴うセミオートノムエクスプローラを含む4つの実世界ベンチマークにおいて、安全で最適な方策を成功裏に計算した。
  • JanitorおよびFolLineのケーススタディでは、最初の反復でタイトなコスト境界(下限:84、上限:88.6 および 715.62、716.83)が得られ、高い許容性と早期収束を示した。
  • ComExpケーススタディでは、初期の下限が低コストの通信不能戦略のため緩く(0.3)であったが、反復を重ねるごとに境界が著しくタイトに(例:7回目の反復で78.2に)なり、反復的改善が確認された。
  • プロトタイプ実装は、2GBのメモリと2.67GHz CPUで全ベンチマークで収束を達成し、実用的妥当性を示した。
  • 研究から、非常に許容性の高いスケジューラは、到達不能な状態に対するソルバの挙動のため、到達可能な状態空間が小さくなりがちなことが判明した。これは、到達可能な状態に制限された許容性の必要性を示唆する。
  • SMTに基づく許容性スケジューラ計算は効果的であったが、ゴール状態への到達可能性を強制するとソルバの性能が低下する傾向にあり、到達可能性とスケーラビリティのトレードオフが生じていることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。