Skip to main content
QUICK REVIEW

[論文レビュー] CUP: A Conservative Update Policy Algorithm for Safe Reinforcement Learning

Long Yang, Jiaming Ji|arXiv (Cornell University)|Feb 15, 2022
Reinforcement Learning in Robotics被引用数 7
ひとこと要約

CUPは、よりタイトなパフォーマンスバインディングと一般化されたアドバンテージ推定(GAE)を surrogate 関数として用いることで、理論的かつ安全な保証を提供する、安全な強化学習のための保守的更新ポリシー手法である。非凸で1次オーダーの最適化を凸近似を用いずに実現でき、連続制御タスクにおいて安全性を維持しながら報酬を向上させる最先端の手法を凌駆する。

ABSTRACT

Safe reinforcement learning (RL) is still very challenging since it requires the agent to consider both return maximization and safe exploration. In this paper, we propose CUP, a Conservative Update Policy algorithm with a theoretical safety guarantee. We derive the CUP based on the new proposed performance bounds and surrogate functions. Although using bounds as surrogate functions to design safe RL algorithms have appeared in some existing works, we develop them at least three aspects: (i) We provide a rigorous theoretical analysis to extend the surrogate functions to generalized advantage estimator (GAE). GAE significantly reduces variance empirically while maintaining a tolerable level of bias, which is an efficient step for us to design CUP; (ii) The proposed bounds are tighter than existing works, i.e., using the proposed bounds as surrogate functions are better local approximations to the objective and safety constraints. (iii) The proposed CUP provides a non-convex implementation via first-order optimizers, which does not depend on any convex approximation. Finally, extensive experiments show the effectiveness of CUP where the agent satisfies safe constraints. We have opened the source code of CUP at https://github.com/RL-boxes/Safe-RL.

研究の動機と目的

  • 報酬の最大化と制約の満たし方の両立を保証することで、強化学習における安全な探索の課題に取り組む。
  • 非凸な目的関数と制約の凸近似に依存することを排除し、誤差と計算コストの増加を回避する。
  • 高次元問題に効率的かつスケーラブルに適用可能な、理論的根拠に基づいたサンプルベースの安全なRLの実装を開発する。
  • 先行研究よりもタイトなパフォーマンスバインディングを提供し、真の目的関数と安全制約のより良い局所的近似を可能にする。
  • 安全性をポリシー射影によって維持しながら、報酬の単調増加を保証する実用的なアルゴリズムを設計する。

提案手法

  • 一般化されたアドバンテージ推定(GAE)を用いて、ポリシー間の新たな一般化された差分バインディングを導出。これにより分散は低減されつつ、バイアスの制御は維持される。
  • 先行研究よりもタイトなパフォーマンスバインディングを提案し、目的関数と制約の局所的近似の質が向上する。
  • 2段階のCUP更新を提案:まず勾配上昇によるポリシー改善、次に安全なポリシー領域への射影による制約の強制。
  • 導出されたバインディングに基づく surrogate 関数を用い、最適化における元の目的関数と制約を置き換える。
  • 逆フィッシャー情報行列の計算が高価であるのを避けるために、非凸最適化を1次オーダーの手法で実現する。
  • 報酬と安全性のバランスをとるためのラグランジュ乗数法を用い、適応的νを導入。改善度と制約違反に関する理論的バインディングを提供する。

実験結果

リサーチクエスチョン

  • RQ1GAEを用いて導出されたよりタイトなパフォーマンスバインディングは、制約付き強化学習におけるポリシー更新の安全性と安定性を向上させることができるか?
  • RQ2これらのバインディングに基づく surrogate 関数は、凸近似を用いずに安全なポリシー最適化を可能にするか?
  • RQ3提案されたCUPアルゴリズムは、報酬の最大化を図りながら安全性を維持する点で、既存の安全RLベースラインをどの程度上回るか?
  • RQ4提案された保守的更新フレームワークにおいて、ポリシーの改善度と制約違反に関する理論的保証は何か?
  • RQ5CUPアルゴリズムは、1次オーダー最適化を用いて、高次元の連続制御環境でも効率的に実装可能か?

主な発見

  • CUPは、先行研究よりもタイトなバインディングを導出することで、理論的かつ安全な保証を達成し、真の目的関数と制約のより良い局所的近似が可能になる。
  • CUPは、速度制限や円形制約を伴うMuJoCoロボットのような安全制約が厳しい環境でも、優れた性能を示し、一貫して安全制約を満たす。
  • CPO、PCPO、FOCOPS、PPO-Lを含む最先端の手法と比較して、複数のベンチマークにおいて、報酬の最大化と制約の遵守の両面でCUPが優れていることが示された。
  • 理論的バインディングにGAEを用いることで、ポリシー更新の分散が低減され、バイアス制御を損なわず、より安定かつ効率的な学習が可能になった。
  • 1次オーダー最適化による非凸実装により、高次元のフィッシャー行列の逆行列計算の必要がなくなり、計算コストが顕著に削減された。
  • 実験的結果から、CUPは、報酬を最大化しながら禁忌領域を避ける必要がある「Circleタスク」のような複雑な環境でも、安全な行動を維持していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。