Skip to main content
QUICK REVIEW

[論文レビュー] Constraint-Conditioned Policy Optimization for Versatile Safe Reinforcement Learning

Yihang Yao, Zuxin Liu|arXiv (Cornell University)|Oct 5, 2023
Adversarial Robustness in Machine LearningComputer Science被引用数 3
ひとこと要約

本稿では、バニシブルバリュー推定(VVE)と条件付き変分推論(CVI)を用いて、再訓練なしに未知の安全制約閾値にゼロショット適応可能な、新たな強化学習フレームワークである条件付き制約付き方策最適化(CCPO)を提案する。CCPOは、再訓練を必要とせず、高いデータ効率で優れた安全性とタスク性能を達成し、高次元制御タスクにおいてベースラインを上回る性能を発揮する。

ABSTRACT

Safe reinforcement learning (RL) focuses on training reward-maximizing agents subject to pre-defined safety constraints. Yet, learning versatile safe policies that can adapt to varying safety constraint requirements during deployment without retraining remains a largely unexplored and challenging area. In this work, we formulate the versatile safe RL problem and consider two primary requirements: training efficiency and zero-shot adaptation capability. To address them, we introduce the Conditioned Constrained Policy Optimization (CCPO) framework, consisting of two key modules: (1) Versatile Value Estimation (VVE) for approximating value functions under unseen threshold conditions, and (2) Conditioned Variational Inference (CVI) for encoding arbitrary constraint thresholds during policy optimization. Our extensive experiments demonstrate that CCPO outperforms the baselines in terms of safety and task performance while preserving zero-shot adaptation capabilities to different constraint thresholds data-efficiently. This makes our approach suitable for real-world dynamic applications.

研究の動機と目的

  • 再訓練を必要とせずに、変化する安全制約閾値に適応可能な包括的で安全な強化学習方策を訓練する課題に対処すること。
  • すべての可能な制約閾値に事前訓練する必要を回避することで、訓練効率を向上させること。
  • 強化学習方策が、強化された安全保証とタスクパフォーマンスを維持したまま、未観測のコスト閾値にゼロショット一般化できることを実現すること。

提案手法

  • 転移学習の原則を用いて、未知の制約閾値に対してもQ値を一般化できる価値関数表現学習手法であるバニシブルバリュー推定(VVE)を導入する。
  • 訓練中に任意の制約閾値に方策を条件づけるために、条件付き変分推論(CVI)を採用し、エンドツーエンド微分可能な方策最適化を実現する。
  • 条件付き変分推論フレームワークを用いて、方策を制約閾値の関数としてモデル化し、推論時に新しい閾値に対する行動方策を推論可能にする。
  • VVEとCVIを統合したオンライン学習パラダイムを採用し、条件付き制約下で方策と価値関数を同時に最適化する。
  • 制約条件を効率的に処理するため、推論プロセスのEステップで凸最適化を適用し、安全性と安定性を確保する。
  • 微調整なしに新しい閾値にデータ効率よく一般化できる、行動方策の条件づけメカニズムを採用する。

実験結果

リサーチクエスチョン

  • RQ1再訓練や微調整なしに、1つの安全RL方策を、未観測の安全制約閾値に一般化できるか?
  • RQ2運用時に、以前に観測されていなかった制約閾値に対する価値関数をどのように推定できるか?
  • RQ3訓練時に制約閾値に方策を条件づけることで、ゼロショット適応性能にどのような影響を与えるか?
  • RQ4提案手法は、ベースラインの制約付きRLアプローチと比較して、安全性とデータ効率の面でどのように異なるか?
  • RQ5フレームワークは、多様な閾値条件下で、低い制約違反を維持しながら高いタスクパフォーマンスを維持できるか?

主な発見

  • CCPOは、アブレーションバージョンやベースラインと比較して、著しく低いコスト違反(例:Ball-Circleでは0.59 ± 0.31)を達成し、強力な安全一般化を示している。
  • Ant-Runタスクでは、CCPOは高い報酬(660.88 ± 4.82)と低いコスト違反(3.13 ± 1.67)を維持しているが、VVEを除いたアブレーションCCPOは報酬が428.59 ± 88.39に低下し、コスト違反は10.66 ± 11.81に上昇している。
  • Drone-Runタスクにおいて、CCPO w/o VVEは平均報酬が25%低下し、コスト違反が6倍以上に増加しており、VVEが価値一般化において極めて重要な役割を果たしていることが示されている。
  • CCPO w/o CVIは、コスト違反が高くなる(例:Ball-Circleでは1.44 ± 0.72)と同時に報酬が低下(641.33 ± 40.14)しており、CVIが制約閾値に条件づけられた方策学習において不可欠であることが証明されている。
  • 図2の滑らかな性能曲線から、CCPOは閾値条件にわたって滑らかに一般化していることが示されており、制約条件の有効な符号化が実現されている。
  • 高次元の状態空間と行動空間(例:Ant-Run)において、すべてのベースライン手法は安全適応を達成できなかったが、CCPOは強固なパフォーマンスと安全性を維持している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。