Skip to main content
QUICK REVIEW

[論文レビュー] Safe and Efficient Reinforcement Learning Using Disturbance-Observer-Based Control Barrier Functions

Yikun Cheng, Zhao Pan|arXiv (Cornell University)|Nov 30, 2022
Reinforcement Learning in Robotics被引用数 5
ひとこと要約

本稿は、不確実性モデルの学習を必要とせず、安全を保証するモデルフリーな安全強化学習フレームワークを提案する。不確実性の推定をリアルタイムで行い、二次計画法を用いてロバストな制御バリア関数(CBF)条件を満たすことで、ガウス過程ベースのCBF手法と比較して、安全違反率が著しく低く、サンプル効率および計算効率が優れている。この手法は、ユニクルや2Dクアッドローター上で実証された。

ABSTRACT

Safe reinforcement learning (RL) with assured satisfaction of hard state constraints during training has recently received a lot of attention. Safety filters, e.g., based on control barrier functions (CBFs), provide a promising way for safe RL via modifying the unsafe actions of an RL agent on the fly. Existing safety filter-based approaches typically involve learning of uncertain dynamics and quantifying the learned model error, which leads to conservative filters before a large amount of data is collected to learn a good model, thereby preventing efficient exploration. This paper presents a method for safe and efficient RL using disturbance observers (DOBs) and control barrier functions (CBFs). Unlike most existing safe RL methods that deal with hard state constraints, our method does not involve model learning, and leverages DOBs to accurately estimate the pointwise value of the uncertainty, which is then incorporated into a robust CBF condition to generate safe actions. The DOB-based CBF can be used as a safety filter with model-free RL algorithms by minimally modifying the actions of an RL agent whenever necessary to ensure safety throughout the learning process. Simulation results on a unicycle and a 2D quadrotor demonstrate that the proposed method outperforms a state-of-the-art safe RL algorithm using CBFs and Gaussian processes-based model learning, in terms of safety violation rate, and sample and computational efficiency.

研究の動機と目的

  • 不確実性の定量化にガウス過程回帰を用いる従来の安全強化学習手法の非効率性と過剰な保守性を是正すること。
  • 動的モデルの学習を不要としつつも、硬い安全制約を維持したまま、モデルフリー強化学習における安全な探索を可能にすること。
  • 計算コストの高いガウス過程モデルを不確実性観測器に置き換えることで、サンプル効率および計算効率を向上させること。
  • 正確なリアルタイムの不確実性推定と事前に計算可能な推定誤差境界を用いて、ロバストな安全確保を実現すること。
  • ガウス過程ベースの不確実性モデリングを用いた最先端のCBFに基づく安全強化学習と比較して、優れた安全性と効率性を示すこと。

提案手法

  • リアルタイムで、不確実性の集約(未モデル化ダイナミクス)の点ごとの値を不確実性観測器(DOB)で推定する。
  • DOBの不確実性推定の精度を定量化する、事前に計算可能な推定誤差境界(EEB)を用いる。
  • 推定された不確実性とEEBを統合し、ロバストな制御バリア関数(CBF)条件を定義して安全確保を実現する。
  • 二次計画法(QP)を用いて、ロバストCBF条件を満たす最小限の行動補正を計算し、安全を確保しつつポリシーの逸脱を最小限に抑える。
  • ポリシー学習プロセスを変更せずに、任意のモデルフリー強化学習アルゴリズムとシームレスに統合可能な安全フィルタとして動作する。
  • 真のシステムダイナミクスや不確実性分布の学習を必要とせず、既知のノミナルモデルのみに依存する。

実験結果

リサーチクエスチョン

  • RQ1不確実性観測器に基づくCBFフレームワークは、動的モデルの学習を必要とせずに、モデルフリー強化学習における安全な探索を達成できるか?
  • RQ2訓練中における安全違反率の観点から、DOB-CBF手法はガウス過程ベースのCBF手法と比べてどのように異なるか?
  • RQ3高次元のロボット制御タスクにおいて、DOB-CBF-RLはGP-CBF-RLと比較して、計算およびサンプル効率に優れているか?
  • RQ4さまざまな訓練段階において、DOBが提供する不確実性推定はどれほど安定的で正確か?
  • RQ5DOB-CBFフレームワークは、安全を維持しつつ、どれほど積極的かつ効率的なポリシー学習を可能にするか?

主な発見

  • 2Dクアッドローターにおいて、DOB-CBF-RLは最終1500〜2000エピソードで安全違反率0.0%を達成したのに対し、GP-CBF-RLは40.4%であった。
  • 初期訓練段階(エピソード1〜500)において、DOB-CBF-RLの安全違反率は15.8%であったが、GP-CBF-RLは91.4%であった。これは初期段階での著しい安全性の向上を示している。
  • 事前学習を施した場合、GP-CBF-RLの違反率は最初の500エピソードで30.8%に低下したが、依然としてDOB-CBF-RL(15.8%)に劣っていた。
  • DOBは初期段階から誤差が5%未満で安定した不確実性推定を提供したが、GPモデルは500,000ステップ以上を経てやっと誤差を5%未満に低下させた。
  • DOB-CBF-RLの1,000ステップあたりの平均計算時間は、GP-CBF-RLの少なくとも3倍以上速く、計算効率の優位性が顕著に現れた。
  • DOB-CBF-RLエージェントは6,000エピソードで高性能なポリシーを学習したが、GP-CBF-RLエージェントは同じ回数のエピソードでは同等のポリシーに収束できず、サンプル効率の優位性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。