Skip to main content
QUICK REVIEW

[論文レビュー] In-Distribution Barrier Functions: Self-Supervised Policy Filters that Avoid Out-of-Distribution States

Fernando Castañeda, Haruki Nishimura|arXiv (Cornell University)|Jan 27, 2023
Model Reduction and Neural Networks被引用数 5
ひとこと要約

本稿では、学習された潜在状態表現を活用して、視覚ベースのロボット系が安全なオффラインデモンストレーションの分布内にとどまるようにする自己教師付きポリシー絞り込み手法であるIn-Distribution Barrier Functions (iDBF)を提案する。iDBFは、ダイナミクスモデルや不安全データを必要とせず、高次元の視覚的観測に制御バリア関数を適応することで、最小限の干渉で分布外行動や衝突率を著しく低減する。シミュレーションタスクにおいて、これは著しい性能向上をもたらす。

ABSTRACT

Learning-based control approaches have shown great promise in performing complex tasks directly from high-dimensional perception data for real robotic systems. Nonetheless, the learned controllers can behave unexpectedly if the trajectories of the system divert from the training data distribution, which can compromise safety. In this work, we propose a control filter that wraps any reference policy and effectively encourages the system to stay in-distribution with respect to offline-collected safe demonstrations. Our methodology is inspired by Control Barrier Functions (CBFs), which are model-based tools from the nonlinear control literature that can be used to construct minimally invasive safe policy filters. While existing methods based on CBFs require a known low-dimensional state representation, our proposed approach is directly applicable to systems that rely solely on high-dimensional visual observations by learning in a latent state-space. We demonstrate that our method is effective for two different visuomotor control tasks in simulation environments, including both top-down and egocentric view settings.

研究の動機と目的

  • データ駆動型ビジュオモーター制御における分布シフトの課題に対処すること。これは、ポリシーがトレーニングデータから逸脱した場合に失敗するという問題である。
  • システムのダイナミクスや不安全なデモンストレーションに関する事前知識が不要な安全フィルタを開発すること。
  • 自己教師付き学習を用いて潜在状態空間に制御バリア関数(CBF)を拡張し、高次元の視覚的観測に適用すること。
  • 潜在空間内の分布内領域に制御入力を制限することで、最小限の干渉で安全性を維持すること。
  • オフラインで安全なデモンストレーションのみを用いて、現実のロボットシステムで頑健かつ分布に配慮した制御を可能にすること。

提案手法

  • 対照的自己教師付き学習を用いて、高次元のRGB観測から潜在状態空間表現を学習する。
  • オフラインで安全なデモンストレーションのみを用いて、潜在空間における制御バリア関数(CBF)に基づくポリシー・フィルタを訓練する。
  • トレーニングデータの分布のサポート内にシステムが留まるように保証するバリア条件を課す。
  • 各タイムステップでバリア制約を満たす最小干渉制御入力を計算するために二次計画法(QP)を用いる。
  • 安全な軌道の分布を保持するように、潜在表現を促進する対照的学習目的関数を採用する。
  • システムのダイナミクスの明示的モデリングや不安全な軌道へのアクセスを必要としない。

実験結果

リサーチクエスチョン

  • RQ1明示的なダイナミクスモデルがなくても、高次元の視覚的観測に制御バリア関数を効果的に適用できるか?
  • RQ2自己教師付き手法が、オフラインで安全なデモンストレーションのみから分布に配慮した安全フィルタを学習できるか?
  • RQ3潜在空間における学習済みバリア関数が、ビジュオモーター制御タスクにおける分布外行動を顕著に低減できるか?
  • RQ4ベースラインのフィルタリング手法と比較して、提案手法iDBFは安全性と干渉コストの両面で優れているか?
  • RQ5シミュレーションにおいて、異なる視覚的視点(例:トップダウン対エゴセントリック)間で一般化できるか?

主な発見

  • iDBFは、ロボットナビゲーションおよびドライブシミュレーションタスクの両方で衝突率をほぼゼロにまで低減し、フィルタを施さない基準ポリシーを著しく上回る。
  • ロボットナビゲーションタスクでは、iDBFは0.0%の衝突率を達成したのに対し、フィルタなしポリシーは15.2%であった。干渉は最小限に抑えられた。
  • ドライブシミュレーションでは、iDBFはフィルタなしベースラインの12.8%から0.0%まで衝突率を低下させ、高いタスクパフォーマンスを維持した。
  • BC密度フィルターやアンサンブル分散フィルターベースラインですら、きついしきい値を用いても、iDBFは安全性において優れている。
  • BC密度フィルターは、低衝突率を達成する代わりに、極めて高いフィルタ干渉率を示しており、過剰なフィルタリングであることが示された。
  • iDBFは、すべての手法の中で最小の累積的フィルタ干渉率を達成しており、基準ポリシーへの干渉が最小限であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。