Skip to main content
QUICK REVIEW

[論文レビュー] Towards Safe Reinforcement Learning with a Safety Editor Policy

Haonan Yu, Wei Xu|arXiv (Cornell University)|Jan 28, 2022
Adversarial Robustness in Machine Learning被引用数 12
ひとこと要約

SEditorは、安全な強化学習のための二政策フレームワークを提案する。有用性を最大化するポリシーが行動を提案し、安全を確保するための補正を施す安全エディターポリシーがそれを修正する。2,000ステップに1回の制約違反率という、最先端の性能を達成し、14の安全強化学習ベンチマークでベースラインを著しく上回る。

ABSTRACT

We consider the safe reinforcement learning (RL) problem of maximizing utility with extremely low constraint violation rates. Assuming no prior knowledge or pre-training of the environment safety model given a task, an agent has to learn, via exploration, which states and actions are safe. A popular approach in this line of research is to combine a model-free RL algorithm with the Lagrangian method to adjust the weight of the constraint reward relative to the utility reward dynamically. It relies on a single policy to handle the conflict between utility and constraint rewards, which is often challenging. We present SEditor, a two-policy approach that learns a safety editor policy transforming potentially unsafe actions proposed by a utility maximizer policy into safe ones. The safety editor is trained to maximize the constraint reward while minimizing a hinge loss of the utility state-action values before and after an action is edited. SEditor extends existing safety layer designs that assume simplified safety models, to general safe RL scenarios where the safety model can in theory be arbitrarily complex. As a first-order method, it is easy to implement and efficient for both inference and training. On 12 Safety Gym tasks and 2 safe racing tasks, SEditor obtains much a higher overall safety-weighted-utility (SWU) score than the baselines, and demonstrates outstanding utility performance with constraint violation rates as low as once per 2k time steps, even in obstacle-dense environments. On some tasks, this low violation rate is up to 200 times lower than that of an unconstrained RL method with similar utility performance. Code is available at https://github.com/hnyu/seditor.

研究の動機と目的

  • 安全知識や事前学習のない環境における安全強化学習を解決すること。
  • 制約違反率を2,000ステップに1回程度という極めて低い水準にまで低下させること。ただし、オракルの安全モデルに依存しないこと。
  • 二政策アーキテクチャを用いて有用性最大化と安全確保を分離し、効率的で協調的な学習を可能にすること。
  • 一階微分の計算効率の高い手法を構築し、単純化された安全モデルを超えて一般化可能であることを目指すこと。
  • 厳格な安全制約下でのシミュレーションから実世界への転送および実世界への展開を可能にすること。

提案手法

  • 有用性最大化(UM)ポリシーは、確率的方策勾配降下法を用いて有用性報酬を最大化するように学習する。
  • 安全エディター(SE)ポリシーは、行動編集前の状態行動価値と編集後の状態行動価値の間のヘッジ損失を最小化するとともに、制約報酬を最大化するように学習する。
  • SEポリシーは、現在の状態 s と UM が提案した行動 â に基づいて、行動補正 Δa を出力し、最終的な行動 a = h(s, â, Δa) を形成する。
  • サンプル効率と安定した最適化を実現するため、経験再生を用いたオフポリシー学習を採用する。
  • 目的関数のバランスを動的に調整するため、原双対最適化手法を用いる。
  • 二つのポリシーは確率的勾配降下法により同時に学習され、ハードスイッチングや複雑なヒューリスティクスを必要としないエンドツーエンドの学習が可能になる。

実験結果

リサーチクエスチョン

  • RQ1二政策フレームワークは、安全と有用性のトレードオフにおいて、単一ポリシーの安全強化学習手法を上回ることができるか?
  • RQ2環境の安全モデルに関する事前知識がなくても、安全エディターポリシーは制約違反を効果的に低減できるか?
  • RQ3高密度な障害物を有する多様で複雑な安全強化学習環境において、本手法はどのようにスケーリングするか?
  • RQ4本手法は、最小限の事前安全情報での実世界展開シナリオにどの程度一般化できるか?
  • RQ5本手法は、高い有用性性能を維持しながら、ほぼゼロに近い制約違反率を達成できるか?

主な発見

  • SEditorは、12のSafety Gymタスクと2つの安全レーシングタスクにおいて、4つのベースラインと比較して顕著に高い安全重み付き有用性(SWU)スコアを達成した。
  • 本手法は、高密度な障害物環境ですら、2,000ステップに1回という極めて低い制約違反率を達成した。
  • 一部のタスクでは、同等の有用性性能を示す非制約付きRL手法と比較して、違反率が最大200倍も低かった。
  • 安全エディターポリシーは、有用性の低下を最小限に抑えつつ安全性を確保しており、行動編集におけるヘッジ損失が低かったことから、その有効性が裏付けられた。
  • ランダムにレイアウトが変更された多様な環境においても、本手法は優れた一般化性能を示し、安全一般化の強さを示した。
  • SEditorは計算的に効率的でスケーラブルであり、一階微分最適化とオフポリシー学習を活用することで、高速な収束を実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。