Skip to main content
QUICK REVIEW

[論文レビュー] Saute RL: Almost Surely Safe Reinforcement Learning Using State Augmentation

Aivar Sootla, Alexander I. Cowen-Rivers|arXiv (Cornell University)|Feb 14, 2022
Autonomous Vehicle Technology and Safety被引用数 9
ひとこと要約

本稿では、安全予算を状態空間に追加することで、確率1で安全制約を満たす強化学習手法Sauté RLを提案する。安全予算が尽きた場合には無限のペナルティを割り当てる報酬の再設計により、任意のオフザシェル強化学習アルゴリズムと互換性を保ちつつ、安全を保証する。ペンデュラムのスイングアップや自動車ナビゲーションといった安全が求められる環境において、最先端の手法を上回る性能を発揮する。

ABSTRACT

Satisfying safety constraints almost surely (or with probability one) can be critical for the deployment of Reinforcement Learning (RL) in real-life applications. For example, plane landing and take-off should ideally occur with probability one. We address the problem by introducing Safety Augmented (Saute) Markov Decision Processes (MDPs), where the safety constraints are eliminated by augmenting them into the state-space and reshaping the objective. We show that Saute MDP satisfies the Bellman equation and moves us closer to solving Safe RL with constraints satisfied almost surely. We argue that Saute MDP allows viewing the Safe RL problem from a different perspective enabling new features. For instance, our approach has a plug-and-play nature, i.e., any RL algorithm can be "Sauteed". Additionally, state augmentation allows for policy generalization across safety constraints. We finally show that Saute RL algorithms can outperform their state-of-the-art counterparts when constraint satisfaction is of high importance.

研究の動機と目的

  • 航空機運用や自動運転などの実世界の強化学習応用において、安全制約が確率1で満たされることを保証する挑戦に取り組む。
  • 期待値や高い確率での制約満たししか保証しない従来の安全強化学習手法の限界を克服する。
  • 学習目的を変更せずに、任意の標準的強化学習アルゴリズムと統合可能な汎用的でプラグアンドプレイなフレームワークを開発する。
  • 状態の拡張により、異なる安全予算に対してポリシーの一般化を可能にし、1つのポリシーで複数の安全閾値を処理できるようにする。

提案手法

  • 安全制約の満たし方を状態依存の報酬形状に変換するため、残りの安全予算を追加の状態変数として埋め込むことで、安全拡張(Sauté)MDPを導入する。
  • 安全予算が尽きた場合には無限の負の報酬を割り当てる報酬関数の再設計により、予算を超過するいかなる軌道に対しても厳密にペナルティを与える。
  • ベルマン方程式が成り立つ新たなMDPを構築し、PPO、TRPO、SACなどの標準的なクライアントベース強化学習アルゴリズムの使用を可能にする。
  • OpenAI Gym環境のラッパーとして実装し、既存の任意の強化学習アルゴリズムをシームレスに「Sauté化」可能にする。
  • 状態拡張を用いて一般化を実現:1つの安全予算で訓練されたポリシーが他の予算にも一般化可能であり、安全予算のランダム初期化により複数の予算間での統合学習が可能になる。
  • 実験的評価を通じて、モデルフリー(例:PPO、SAC)およびモデルベース(例:MBPO、PETS)の両方の強化学習アルゴリズムに適用可能であることを示す。

実験結果

リサーチクエスチョン

  • RQ1一般的でモジュラーな強化学習フレームワークを用いて、安全制約を確率1で満たすことは可能か?
  • RQ2安全予算の状態拡張は、標準的強化学習アルゴリズムの性能および安定性にどのように影響するか?
  • RQ31つの安全予算で訓練された1つのポリシーが、複数の異なる安全予算に一般化可能か?
  • RQ4Sauté RLアプローチは、ラグランジュ法やその他の最先端の安全強化学習手法に比べ、制約満たしの正確性とタスクパフォーマンスの両面で優れているか?
  • RQ5アーキテクチャの変更なしに、モデルフリーおよびモデルベースの強化学習アルゴリズムに適用可能か?

主な発見

  • Sauté TRPOは、ダブルペンダラム環境で100の軌道すべてで100%の制約満たしを達成し、最大の安全コストは常に40の予算以下を維持した。
  • ペンデュラムスイングアップタスクでは、Sauté SAC([64,64]ネットワーク)が平均で安全コストを39.7未満に保ち、ラグランジュ法SACを上回り、ほぼ確実な安全を確保した。
  • リーチャ環境では、Sauté TRPOが平均安全コスト4.51、90%分位数8.78を達成し、CPO(9.95)およびTRPO-Lagrangian(6.44)を大きく下回り、優れた安全性能を示した。
  • ポイントゴールおよびカー・ゴールタスクでは、Sauté RLが90%のケースで最大安全コストをほぼゼロ(0.00)に抑え、ベースラインのPID-Lagrangian(最大59.78)およびCVaR-TRPO(最大58.04)を大きく上回った。
  • 本手法は一般化を示した:1つの安全予算で訓練されたポリシーが他の予算にも適応可能であり、安全予算のランダム初期化により複数の閾値間での統合学習が可能だった。
  • 特に制約満たしの優先度が高い状況において、安全が求められるベンチマークで最先端の手法を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。