Skip to main content
QUICK REVIEW

[論文レビュー] Towards Safe Reinforcement Learning via Constraining Conditional Value-at-Risk

Chengyang Ying, Xinning Zhou|arXiv (Cornell University)|Jun 9, 2022
Safety Systems Engineering in Autonomy被引用数 6
ひとこと要約

本稿では、条件付きリスク価値(CVaR)を用いて遷移と観測の摂動の両方におけるリスクを制約する、安全な強化学習アルゴリズムであるCVaRプロキシマルポリシー最適化(CPPO)を提案する。性能低下と価値関数範囲(VFR)の理論的関係を確立することで、最悪ケースの結果に対して過剰にペナルティを与えることなく、ロバスト性を最適化し、MuJoCoの連続制御タスクにおいて、両方の摂動タイプに対してより高い累積報酬と優れたロバスト性を達成する。

ABSTRACT

Though deep reinforcement learning (DRL) has obtained substantial success, it may encounter catastrophic failures due to the intrinsic uncertainty of both transition and observation. Most of the existing methods for safe reinforcement learning can only handle transition disturbance or observation disturbance since these two kinds of disturbance affect different parts of the agent; besides, the popular worst-case return may lead to overly pessimistic policies. To address these issues, we first theoretically prove that the performance degradation under transition disturbance and observation disturbance depends on a novel metric of Value Function Range (VFR), which corresponds to the gap in the value function between the best state and the worst state. Based on the analysis, we adopt conditional value-at-risk (CVaR) as an assessment of risk and propose a novel reinforcement learning algorithm of CVaR-Proximal-Policy-Optimization (CPPO) which formalizes the risk-sensitive constrained optimization problem by keeping its CVaR under a given threshold. Experimental results show that CPPO achieves a higher cumulative reward and is more robust against both observation and transition disturbances on a series of continuous control tasks in MuJoCo.

研究の動機と目的

  • 安全な強化学習における遷移と観測の摂動の両方を統一的に分析・対処するための手法と分析の欠如に対処すること。
  • 最悪ケースに基づく手法の過剰な悲観的評価を克服するため、CVaRを用いたリスク感受性の目的関数を導入すること。
  • 価値関数範囲(VFR)を介して、構造的に異なる摂動(遷移 vs. 観測)におけるポリシーのロバスト性を理論的に結びつけること。
  • 累積報酬のCVaR制約を軌道に適用することで、平均パフォーマンスを犠牲にせずにロバスト性を向上させる実用的なアルゴリズムCPPOを開発すること。
  • 遷移と観測の摂動の両方の下で、CPPOのロバスト性と累積報酬における優位性を実証的に検証すること。

提案手法

  • 理論的分析により、遷移および観測の摂動下での性能低下が、最高状態価値と最悪状態価値の差である価値関数範囲(VFR)によって上限付けられることを示した。
  • 軌道報酬のCVaRをリスク指標として用い、これは価値関数のCVaRの下界であることが証明され、VFRよりも推定が容易である。
  • 期待累積報酬を最大化すると同時に、報酬のCVaRを事前に定めたしきい値以下に保つ制約付き最適化問題を定式化した。
  • CPPOアルゴリズムは、Proximal Policy Optimization(PPO)を拡張し、CVaR正則化を組み込み、リスク制約下での学習を安定化させるためにクリッピングされた補助目的関数を用いた。
  • リスクに配慮したポリシー更新を統合し、より高いCVaRを持つ軌道を優先することで、遷移および観測の摂動の両方に対してロバスト性を向上させた。
  • 実験的評価では、標準的なMuJoCo連続制御環境に遷移および観測の摂動を注入し、ロバスト性をテストした。

実験結果

リサーチクエスチョン

  • RQ1価値関数範囲(VFR)は、遷移および観測の摂動下でのポリシーのロバスト性とどのように関係するか?
  • RQ2軌道報酬のCVaRは、両方の摂動タイプ下でのリスク感受性ポリシー最適化の実用的かつ効果的な代理指標として機能できるか?
  • RQ3CVaR制約付き最適化フレームワークは、同時に発生する遷移および観測の不確実性に対しても、高いパフォーマンスとロバスト性を示すポリシーを導くか?
  • RQ4CPPOは、摂動下での累積報酬とロバスト性において、既存の安全な強化学習手法と比較してどのように差をつけるか?
  • RQ5提案手法は、最悪ケースに基づくアプローチの過剰な悲観的評価を避けつつ、不確実性下でも強力なパフォーマンスを維持できるか?

主な発見

  • CPPOは、HalfCheetah、Walker2d、Swimmer、Hopperの各タスクにおいて、PPO、VPG、TRPO、PG-CMDPと比較してより高い累積報酬を達成し、サンプル効率とパフォーマンスの両面で向上を示した。
  • 遷移摂動(質量の摂動)下では、CPPOはベースラインと比較して顕著に高いパフォーマンスを維持し、特にSwimmerとHopperで環境動的変化に対する強いロバスト性を示した。
  • 観測摂動(ガウスノイズ)下では、CPPOはすべてのベースラインと比較して優れたロバスト性を示し、高ノイズレベル下でも最小限のパフォーマンス低下に抑えられ、観測不確実性に対する有効性を確認した。
  • CPPOは、VFRが低いにもかかわらずPG-CMDPやVPGを上回るロバスト性を示した。これは、CPPOがVFRの低さに依存するのではなく、CVaR正則化を通じて能動的にリスクを制御しているためである。
  • 付録Cに報告されているように、CPPOはすべての比較ベースラインと比較して、悪意のある観測攻撃に対しても優れたロバスト性を示した。これは、最悪の観測破損に対しても耐性があることを確認した。
  • 理論的分析により、軌道報酬のCVaRが価値関数のCVaRの下界であることが確認され、ポリシー最適化における実用的リスク代理指標としての有効性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。