Skip to main content
QUICK REVIEW

[論文レビュー] Recursively Feasible Probabilistic Safe Online Learning with Control Barrier Functions

Fernando Castañeda, Jason J. Choi|arXiv (Cornell University)|Aug 23, 2022
Gaussian Processes and Bayesian Inference被引用数 4
ひとこと要約

本稿では、ガウス過程埋め込み制御バリア関数(GP-CBF)を用いて、安全制御の再帰的実行可能性を保証する確率的オンライン学習フレームワークを提案する。イベントトリガー型のデータ収集と不確実性を考慮した最適化を組み合わせることで、未探索領域でさえも高い確率で安全領域の前向き不変性を保証する。また、安全を維持するためにいつ新しいデータが必要かを動的に判断する。

ABSTRACT

Learning-based control has recently shown great efficacy in performing complex tasks for various applications. However, to deploy it in real systems, it is of vital importance to guarantee the system will stay safe. Control Barrier Functions (CBFs) offer mathematical tools for designing safety-preserving controllers for systems with known dynamics. In this article, we first introduce a model-uncertainty-aware reformulation of CBF-based safety-critical controllers using Gaussian Process (GP) regression to close the gap between an approximate mathematical model and the real system, which results in a second-order cone program (SOCP)-based control design. We then present the pointwise feasibility conditions of the resulting safety controller, highlighting the level of richness that the available system information must meet to ensure safety. We use these conditions to devise an event-triggered online data collection strategy that ensures the recursive feasibility of the learned safety controller. Our method works by constantly reasoning about whether the current information is sufficient to ensure safety or if new measurements under active safe exploration are required to reduce the uncertainty. As a result, our proposed framework can guarantee the forward invariance of the safe set defined by the CBF with high probability, even if it contains a priori unexplored regions. We validate the proposed framework in two numerical simulation experiments.

研究の動機と目的

  • オンライン学習における安全のジレンマに対処する。具体的には、十分なデータが得られないため安全に展開できないが、展開がデータ収集に不可欠であるという状況である。
  • 近似モデルと実際の動的特性のギャップを埋めるために、ガウス過程(GP)回帰を用いて制御バリア関数における不確実性をモデル化する。
  • 利用可能なデータおよびシステムの動的特性に関する豊かさ条件を導出することで、安全制御入力を常に実行可能に保つ。
  • 再帰的実行可能性と安全性を維持するために、いつ新しい測定が必要かを判断するイベントトリガー型のデータ収集戦略を開発する。
  • 未事前に探索された状態空間の領域でさえも、高い確率で安全領域の前向き不変性を形式的に保証する。

提案手法

  • システム動的特性における不確実性をモデル化するため、ガウス過程回帰を用いて制御バリア関数(CBF)を再定式化し、GP-CBF-SOCP(第二順序コーン計画)の定式化を導出する。
  • スカラ量 $ p $ の符号に基づく実行可能性条件を導入し、これにより現在のデータとモデル不確実性のもとで安全な制御入力が存在するかを判定する。
  • イベントトライガー型のデータ収集メカニズムを定義し、$ p \leq 0 $ の場合にのみ作動させることで、安全を保証するための情報が不十分であると判断した際に新しい測定を促す。
  • 新しいデータが臨界方向 $ e_{\dagger} $ に沿って不確実性を低下させるように、事後分散の更新則を用いることで、時間経過とともに実行可能性が向上することを保証する。
  • 強い凸性および制約規準を活用し、安全制御則の局所リプシッツ連続性を証明することで、閉ループ軌道の局所的存在および一意性を保証する。
  • パrametric最適化の理論的結果を応用し、GP-CBF-SOCPが常に実行可能であり、安全制御入力をリアルタイムで計算可能であることを保証する。

実験結果

リサーチクエスチョン

  • RQ1モデル不確実性と限られたデータのもとで、GP-CBFに基づく安全制御器が再帰的に実行可能である条件は何か?
  • RQ2オンライン学習中に安全性を維持するために、いつ新しいデータ収集が必要かを形式的に判断する方法は何か?
  • RQ3未探索の状態空間領域でも、安全領域の前向き不変性を高い確率で保証できるか?
  • RQ4どのようなデータ収集戦略が、モデルの信頼性を高める一方でシステムの安全性を維持するか?
  • RQ5GP回帰とCBFの統合により、オフラインデータや完璧なモデルがなくても、安全で適応的な学習が可能になる仕組みは何か?

主な発見

  • 提案されたGP-CBF-SOCPは、スカラ量 $ p > 0 $ である場合にのみ実行可能であり、幾何学的にはCBF制約の超平面が第二順序コーンの漸近線よりも上にあることに相当する。
  • $ p \leq 0 $ の場合、CBF制約は実行不能となり、安全な制御入力を計算できる情報が不足していることを示唆し、新しいデータ収集が必要である。
  • $ p $-条件に基づくイベントトライガー型データ収集により、システムは必要最小限の回数でのみデータ収集を行うため、再帰的実行可能性と安全性が維持される。
  • 新しいデータポイントを追加した後、臨界方向 $ e_{\dagger} $ に沿った事後分散が低下し、$ \lambda_{\dagger} < 0 $ が達成され、実行可能性が回復する。
  • 強い凸性および制約規準のおかげで、安全制御入力 $ u_{\text{safe}} $ は局所リプシッツ連続であるため、閉ループシステムの適切な定式化が保証される。
  • 確率的不確実性モデルと適応的データ収集のおかげで、未事前に探索された領域であっても、安全領域の前向き不変性に関する形式的な高確率保証が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。