Skip to main content
QUICK REVIEW

[論文レビュー] Constrained Policy Optimization via Bayesian World Models

Yarden As, Ilnura Usmanova|arXiv (Cornell University)|Jan 24, 2022
Autonomous Vehicle Technology and Safety被引用数 11
ひとこと要約

LAMBDAは、不確実性を考慮したトラジェクトリーロールアウトと拡張ラグランジュ最適化を活用することで、不確実性を伴う世界モデルを用いて、楽観的な探索と懐疑的な制約処理のバランスをとるベイジアンモデルベース強化学習アルゴリズムである。安全で高いサンプル効率性を達成し、Safety-Gym SG6ベンチマークで完全な制約満足を実現している。

ABSTRACT

Improving sample-efficiency and safety are crucial challenges when deploying reinforcement learning in high-stakes real world applications. We propose LAMBDA, a novel model-based approach for policy optimization in safety critical tasks modeled via constrained Markov decision processes. Our approach utilizes Bayesian world models, and harnesses the resulting uncertainty to maximize optimistic upper bounds on the task objective, as well as pessimistic upper bounds on the safety constraints. We demonstrate LAMBDA's state of the art performance on the Safety-Gym benchmark suite in terms of sample efficiency and constraint violation.

研究の動機と目的

  • 実世界の強化学習におけるサンプル非効率性と安全性の課題に取り組むことにより、高リスク環境における安全で効率的なポリシー学習を可能にすること。
  • 安全制約をコスト関数でモデル化した制約付きマルコフ決定過程(CMDP)に、ベイジアンモデルベース強化学習を拡張すること。
  • モデルの不確実性を活用して楽観的な探索と懐疑的な安全境界を実現することで、サンプル効率を向上させつつ厳密な制約満足を保証すること。
  • 環境のダイナミクスや安全仕様に関する事前知識なしに、エンドツーエンドの観測ベースポリシー学習を可能にすること。

提案手法

  • LAMBDAはベイジアン世界モデルを用いて、モデル生成トラジェクトリを生成し、タスクの目的関数に対する楽観的な上界と安全制約に対する懐疑的な上界を推定する。
  • 制約付き最適化問題を解くために拡張ラグランジュ法を用い、タスク報酬と安全コストペナルティの両方を統合する。
  • 世界モデルの不確実性推定値を逆伝播可能にすることで、微分可能なアクター・クリティックフレームワークによりポリシーを最適化する。
  • 世界モデルの不確実性を活用して、楽観的探索による探索誘導と懐疑的安全境界による安全確保を実現し、リスクとパフォーマンスのバランスを取る。
  • 複数のモデルインスタンスに対するモンテカルロサンプリングを用いて、不確実性下での期待リターンと制約違反の推定を行う。
  • モデルの不確実性を計画プロセスに統合し、CEM-MPCのような短時間スパンで短絡的な計画に依存しない。

実験結果

リサーチクエスチョン

  • RQ1制約付きMDPにおいて、ベイジアン世界モデルを用いて探索と安全性を効果的にバランスさせることができるか?
  • RQ2タスク目的関数の楽観的推定と安全制約の懐疑的推定は、サンプル効率性と制約満足度を向上させることができるか?
  • RQ3Safety-Gymベンチマークにおいて、LAMBDAはモデルフリーおよびモデルベースのベースラインと比較して、安全性とサンプル効率性の両面で優れているか?
  • RQ4モデルの不確実性は、実世界での制約違反なしに安全なポリシー学習を可能にする程度はどの程度か?

主な発見

  • LAMBDAは、Safety-Gym SG6ベンチマークの全タスクで完全な制約満足を達成し、すべてのベースライン手法を上回った。
  • LAMBDAは優れたサンプル効率性を示し、モデルフリーおよびモデルベースのベースラインと比較して、より速く学習し、より高いパフォーマンスを達成した。
  • PointGoal2タスクでは、安全でないバージョンと同等のパフォーマンスを発揮しながらも、安全性を維持した。これは、部分的に観測可能な高リスク環境でも対応可能であることを示している。
  • アブレーションスタディの結果、懐疑的な安全境界を削除すると制約違反が生じることを確認し、懐疑的コンponentの必要性を裏付けた。
  • CEM-MPCを著しく上回る性能を示し、短時間スパンの反復的で排除ベースの手法ではなく、クリティックを活用した長時間スパンの計画が優れていることを示した。
  • 部分的観測下でもDoggoGoal1タスクで複雑な運動ポリシーを成功裏に学習した。これは、状態可視性が制限されても安定性を保つ能力を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。