Skip to main content
QUICK REVIEW

[論文レビュー] Safe Policies for Reinforcement Learning via Primal-Dual Methods

Santiago Paternain, Miguel Calvo-Fullana|arXiv (Cornell University)|Nov 20, 2019
Reinforcement Learning in Robotics被引用数 12
ひとこと要約

本稿では、未知のダイナミクスを有するMDPにおける安全性を保証するため、確率的制約をエルゴディック形に緩和することで勾配ベース最適化を可能にする、プライマルデュアル強化学習手法を提案する。非凸問題において強い双対性を確立し、弱いパrametrization仮定のもとで、収束性と安全性の保証を伴う確率的近似を用いた安全かつ最適な方策の学習が可能となる。

ABSTRACT

In this paper, we study the learning of safe policies in the setting of reinforcement learning problems. This is, we aim to control a Markov Decision Process (MDP) of which we do not know the transition probabilities, but we have access to sample trajectories through experience. We define safety as the agent remaining in a desired safe set with high probability during the operation time. We therefore consider a constrained MDP where the constraints are probabilistic. Since there is no straightforward way to optimize the policy with respect to the probabilistic constraint in a reinforcement learning framework, we propose an ergodic relaxation of the problem. The advantages of the proposed relaxation are threefold. (i) The safety guarantees are maintained in the case of episodic tasks and they are kept up to a given time horizon for continuing tasks. (ii) The constrained optimization problem despite its non-convexity has arbitrarily small duality gap if the parametrization of the policy is rich enough. (iii) The gradients of the Lagrangian associated with the safe-learning problem can be easily computed using standard policy gradient results and stochastic approximation tools. Leveraging these advantages, we establish that primal-dual algorithms are able to find policies that are safe and optimal. We test the proposed approach in a navigation task in a continuous domain. The numerical results show that our algorithm is capable of dynamically adapting the policy to the environment and the required safety levels.

研究の動機と目的

  • 遷移ダイナミクスが未知であるMDPに対して、サンプルされた軌道のみに依存して安全な強化学習方策を設計すること。
  • モデル知識が欠如している状況下でも、時間経過に伴い方策が安全集合内に高い確率で留まるように保証すること。
  • 安全性制約の非凸性と勾配計算の非効率性を克服するため、確率的制約のエルゴディック緩和を導入すること。
  • 非凸性が存在するにもかかわらず、制約付き強化学習問題における強い双対性を確立し、原理的なデュアル最適化を可能にすること。
  • ステップごとに安全と性能の両方の目的に適応する勾配ベースの実用的アルゴリズムを、確率的近似を用いて開発すること。

提案手法

  • パスワイズの安全性を、軌道にわたる時間平均的安全性に置き換えるエルゴディック緩和を導入する。
  • ラグランジュ双対性を用いて制約付き強化学習問題を再定式化し、標準的な強化学習ツールと確率的近似を用いて勾配計算を可能にする。
  • 占有測度と方策パラメータ化を用いて、ラグランジュ関数およびその勾配を状態-行動訪問頻度の観点から表現する。
  • 方策空間の幾何的性質を活用することで、非凸設定下でも弱い条件下でプライマル問題とデュアル問題の間の強い双対性を確立する。
  • ロールアウトから推定された確率的勾配を用いて、方策パラメータとラグランジュ乗数を交互に更新するプライマルデュアルアルゴリズムを適用する。
  • パラメータ化された方策クラス内での最適方策の$ε$-近似を用いて、双対ギャップをバウンディングし、収束を保証する。

実験結果

リサーチクエスチョン

  • RQ1遷移ダイナミクスの知識が一切ない状況でも、安全集合内への高い確率での留まりを保証する安全な強化学習アルゴリズムを設計できるか?
  • RQ2勾配ベース最適化を可能にするために、確率的安全性制約をどのように緩和できるか? その際にも安全性の保証を維持できるか?
  • RQ3非凸な制約付き強化学習問題において強い双対性が成立するか? また、その双対性を最適方策の探索に活用できるか?
  • RQ4パラメータ化された方策学習において、双対ギャップと近似ギャップをどのようにバウンディングできるか? これにより、安全かつ最適な方策への収束を保証できるか?
  • RQ5連続制御タスクにおいて、原理的でデュアルベースのアプローチを用いて、安全と性能の動的バランスをどのようにとれるか?

主な発見

  • 提案されたエルゴディック緩和は、エピソード的および継続的タスクにおいて安全性の保証を維持し、指定された時間枠内に安全集合内に高い確率で留まることが保証される。
  • 方策パラメータ化が十分に豊かであれば、非凸性が存在するにもかかわらず、制約付き強化学習問題における強い双対性が成立し、正確な双対ギャップ制御が可能となる。
  • 双対ギャップは、$ (B_r + \|\lambda^\star_\epsilon\|_1)\epsilon / (1 - \gamma) $ でバウンディングされ、ここで$\epsilon$は方策クラスの近似誤差を制御する。
  • ラグランジュ関数の確率的勾配は、標準的な強化学習技術を用いて計算可能であり、プライマルデュアル更新によるエンドツーエンドの学習が可能となる。
  • 連続的ナビゲーションタスクにおける数値実験では、アルゴリズムが環境の変化や必要な安全性レベルに動的に適応することが示された。
  • ラグランジュ乗数のドメイン特化ハイパーパramータチューニングを一切行わずに、デュアル最適化によってそれらが解かれるため、安全かつ最適な行動を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。