Skip to main content
QUICK REVIEW

[論文レビュー] Robust Constrained-MDPs: Soft-Constrained Robust Policy Optimization under Model Uncertainty

Reazul Hasan Russel, Mouhacine Benosman|arXiv (Cornell University)|Oct 10, 2020
Reinforcement Learning in Robotics参考文献 20被引用数 6
ひとこと要約

本稿では、モデル不確実性下でもパフォーマンスのロバスト性と制約の満足を保証するため、制約付きMDP(CMDP)とロバストMDP(RMDP)を統合する新しいフレームワーク、ロバスト制約付きMDP(RCMDP)を提案する。ラグランジュベースのポリシー勾配アルゴリズムを導入し、最悪ケースのパフォーマンスと累積的制約コストを最適化することで、遷移確率の不確実性があるにもかかわらず、制約を厳密に満たす安全でロバストなインベントリ管理が実現されることを示した。

ABSTRACT

In this paper, we focus on the problem of robustifying reinforcement learning (RL) algorithms with respect to model uncertainties. Indeed, in the framework of model-based RL, we propose to merge the theory of constrained Markov decision process (CMDP), with the theory of robust Markov decision process (RMDP), leading to a formulation of robust constrained-MDPs (RCMDP). This formulation, simple in essence, allows us to design RL algorithms that are robust in performance, and provides constraint satisfaction guarantees, with respect to uncertainties in the system's states transition probabilities. The need for RCMPDs is important for real-life applications of RL. For instance, such formulation can play an important role for policy transfer from simulation to real world (Sim2Real) in safety critical applications, which would benefit from performance and safety guarantees which are robust w.r.t model uncertainty. We first propose the general problem formulation under the concept of RCMDP, and then propose a Lagrangian formulation of the optimal problem, leading to a robust-constrained policy gradient RL algorithm. We finally validate this concept on the inventory management problem.

研究の動機と目的

  • 安全で重要なアプリケーションにおけるモデルフリーおよび非ロバストなモデルベース強化学習のロバスト性と制約満足の欠如に対処すること。
  • 制約付きMDP(CMDP)—安全を保証するためのコスト制約を備える—とロバストMDP(RMDP)—モデル不確実性を扱う—の間のギャップを埋めるために、統一されたRCMDP定式化を提案すること。
  • 最悪の遷移確率下でもパフォーマンスのロバスト性と制約の満足を保証するポリシー勾配アルゴリズムを開発すること。
  • モデル不確実性と硬い安全制約を伴う実世界のインベントリ管理問題に対して、提案手法を検証すること。

提案手法

  • 遷移確率のあいまいさ集合を用いて、CMDPの制約とRMDPの最悪ケースのロバスト性を統合し、RCMDPを定式化する。
  • 最悪のモデル摂動下でのパフォーマンスと制約満足を同時に最適化するため、ラグランジュ双対定式化を導出する。
  • 2段階の時間スケールに基づく確率的ポリシー勾配アルゴリズムを提案:ポリシーのパラメータθは高速更新、ラグランジュ乗数λは遅い更新。
  • 各状態-行動ペアについて、あいまいさ集合上での最小化により、最悪の遷移確率を計算し、ロバスト性を確保する。
  • ノーマルおよび最悪ケースの遷移を用いたモンテカルロロールアウトにより、ポリシーおよび制約の目的関数の勾配推定を実施する。
  • 収束のための標準的な確率的近似条件を用い、θとλの更新の間で時間スケールの分離を実現する。

実験結果

リサーチクエスチョン

  • RQ1モデル不確実性下でも、ロバストなパフォーマンスと制約の満足を両立する統一フレームワークを構築可能か?
  • RQ2CMDPのラグランジュ緩和を、遷移ダイナミクスにおける最悪ケースのモデル摂動を組み込む形に拡張できるか?
  • RQ3提案されたロバスト制約付きポリシー勾配アルゴリズムは、非ロバストまたは非制約付きベースラインと比較して、最悪ケースのパフォーマンスを向上させつつも制約の満足を維持できるか?
  • RQ4不確実なシミュレーションから実世界へのダイナミクス変換(Sim2Real)を、安全で重要なアプリケーションで効果的に処理できるか?

主な発見

  • インベントリ管理問題において、ロバスト制約付きポリシー勾配アルゴリズムは、ロバスト非制約変種よりも高い期待報酬を達成しており、制約下でのパフォーマンス向上を示している。
  • ロバスト制約付きアプローチは、最悪ケース計画によるわずかな期待報酬の低下にもかかわらず、非ロバスト非制約ベースラインに比べてロバスト性と安全性の面で優れている。
  • アルゴリズムはすべてのエピソードにおいて制約予算を厳密に守り、モデル不確実性下でも信頼性の高い制約満足を示した。
  • 非ロバスト非制約ベースラインは高い期待報酬を達成するが、安全保証がないため、パフォーマンスとロバスト性のトレードオフが顕在化している。
  • 2段階の時間スケール更新スキームにより、標準的な確率的近似理論の裏付けのもと、局所サドルポイントへの収束が保証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。