Skip to main content
QUICK REVIEW

[論文レビュー] DOPE: Doubly Optimistic and Pessimistic Exploration for Safe Reinforcement Learning

Archana Bura, Aria HasanzadeZonuzy|arXiv (Cornell University)|Dec 1, 2021
Adversarial Robustness in Machine Learning被引用数 9
ひとこと要約

本稿では、未知のダイナミクスを有する有限ホライズンの制約付きマルコフ決定過程(CMDP)に対して、安全な強化学習のためのモデルベースのアルゴリズムDOPEを提案する。報酬の楽観的ボーナスと制約の悲観的取り扱い、および安全なベースライン方策を組み合わせることで、学習中に安全制約に違反することなく、$\tilde{O}(|\mathcal{S}|\sqrt{|\mathcal{A}|K})$ の目的レグレットを達成し、先行研究の楽観的・悲観的アプローチを実験的に上回る性能を発揮する。

ABSTRACT

Safe reinforcement learning is extremely challenging--not only must the agent explore an unknown environment, it must do so while ensuring no safety constraint violations. We formulate this safe reinforcement learning (RL) problem using the framework of a finite-horizon Constrained Markov Decision Process (CMDP) with an unknown transition probability function, where we model the safety requirements as constraints on the expected cumulative costs that must be satisfied during all episodes of learning. We propose a model-based safe RL algorithm that we call Doubly Optimistic and Pessimistic Exploration (DOPE), and show that it achieves an objective regret $ ilde{O}(|\mathcal{S}|\sqrt{|\mathcal{A}| K})$ without violating the safety constraints during learning, where $|\mathcal{S}|$ is the number of states, $|\mathcal{A}|$ is the number of actions, and $K$ is the number of learning episodes. Our key idea is to combine a reward bonus for exploration (optimism) with a conservative constraint (pessimism), in addition to the standard optimistic model-based exploration. DOPE is not only able to improve the objective regret bound, but also shows a significant empirical performance improvement as compared to earlier optimism-pessimism approaches.

研究の動機と目的

  • 学習段階および実行段階においても安全制約に違反してはならない、制約付きMDPのための安全な探索アルゴリズムを開発すること。
  • 未知の環境において、学習のための探索と安全制約の厳密な遵守の間のバランスをとる課題に対処すること。
  • 学習段階中でさえも、制約違反のない低レグレットを達成すること。
  • モデルベースの楽観的探索と制約の悲観的取り扱い、および安全なベースライン方策を組み合わせることで、既存の楽観的・悲観的アプローチを改善すること。
  • 本手法が、高い制約違反や劣悪なレグレット性能を示す先行手法とは異なり、サブ線形レグレットを達成し、安全を維持することを実験的に検証すること。

提案手法

  • 収集されたエピソードから遷移カーネルを推定するモデルベースのアプローチを用い、経験的モデルの信頼区間を維持する。
  • 低サンプリング状態行動ペアの探索を促進するために、報酬関数に楽観的ボーナスを追加する。
  • 安全制約に違反するリスクを抑えるために、制約関数に悲観的取り扱いを適用し、保守的な方策選択を保証する。
  • 制約を満たすことが保証された安全なベースライン方策$π_b$を用意し、閾値$K_0$に達するまで初期段階で使用する。
  • 各エピソード$k$における方策は、楽観的報酬を最大化しつつ、悲観的制約バウンドを満たす線形計画問題を解くことで計算する。
  • これらの要素を統合したフレームワークを構築し、高い確率で低レグレットとゼロの制約違反を両立させる。

実験結果

リサーチクエスチョン

  • RQ1モデルベースの強化学習アルゴリズムは、学習中に安全制約に違反することなく、CMDP設定でサブ線形の目的レグレットを達成できるか?
  • RQ2報酬における楽観的探索と制約における悲観的取り扱いを組み合わせることで、先行手法と比較して、レグレットと安全性の両面で性能がどのように向上するか?
  • RQ3安全なベースライン方策の使用が、アルゴリズムの収束性とレグレット挙動に与える影響は何か?
  • RQ4OptPessLPアルゴリズムは理論的にはレグレット保証を持つが、なぜ実験的に性能が劣るのか?DOPEはこの問題を克服できるか?
  • RQ5DOPEの性能は、ベースライン方策$π_b$の選択にどれほど敏感か?

主な発見

  • DOPEは、理論的境界と一致する$\tilde{O}(|σ|\sqrt{|σ|× K})$の目的レグレットを達成し、学習全体でゼロの制約レグレットを維持する。
  • 在庫管理環境では、$K_0$エピソードを過ぎるとDOPEの目的レグレットが線形から$\tilde{O}(σ\sqrt{K})$への成長に移行し、理論的分析を裏付ける。
  • DOPEはすべての制約違反を回避するが、OptCMDPはサブ線形の制約レグレットを示しており、学習中に違反が生じていることを示している。
  • OptPessLPは、継続的な線形レグレットを示し、高い悲観的取り扱いが探索を著しく制限していることが示唆される。
  • ベースライン方策$π_b$の選択は性能にやや影響を及ぼすが、DOPEはさまざまな$π_b$の選択に対しても安定性を保つ。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。