Skip to main content
QUICK REVIEW

[論文レビュー] Closing the Closed-Loop Distribution Shift in Safe Imitation Learning.

Stephen Tu, Alexander Robey|arXiv (Cornell University)|Feb 18, 2021
Model Reduction and Neural Networks参考文献 26被引用数 8
ひとこと要約

本稿では、制御リャプノフ関数やバリア関数を用いた最適化ベースの制御方針といった安全な制御方針を、リソース制約下のシステム向けに効率的で証明可能に安全な方針に蒸留する、新しいオンポリシー型模倣学習アルゴリズムであるCMILeを提案する。確率的ミキシング、制約付きポリシー最適化、非線形ロバスト制御を統合することにより、CMILeは閉ループ分布シフトを解消し、タスクの時間枠に依存しない安全で安定した保証を達成する。これは、センシングに基づく入力でも同様に有効である。

ABSTRACT

Commonly used optimization-based control strategies such as model-predictive and control Lyapunov/barrier function based controllers often enjoy provable stability, robustness, and safety properties. However, implementing such approaches requires solving optimization problems online at high-frequencies, which may not be possible on resource-constrained commodity hardware. Furthermore, how to extend the safety guarantees of such approaches to systems that use rich perceptual sensing modalities, such as cameras, remains unclear. In this paper, we address this gap by treating safe optimization-based control strategies as experts in an imitation learning problem, and train a learned policy that can be cheaply evaluated at run-time and that provably satisfies the same safety guarantees as the expert. In particular, we propose Constrained Mixing Iterative Learning (CMILe), a novel on-policy robust imitation learning algorithm that integrates ideas from stochastic mixing iterative learning, constrained policy optimization, and nonlinear robust control. Our approach allows us to control errors introduced by both the learning task of imitating an expert and by the distribution shift inherent to deviating from the original expert policy. The value of using tools from nonlinear robust control to impose stability constraints on learned policies is shown through sample-complexity bounds that are independent of the task time-horizon. We demonstrate the usefulness of CMILe through extensive experiments, including training a provably safe perception-based controller using a state-feedback-based expert.

研究の動機と目的

  • 高周波数で動作する最適化ベースの安全制御方針をリソース制限のあるハードウェアにデプロイする課題に対処すること。
  • カメラのような豊富なセンシング入力を用いるシステムにおいて、最適化ベース制御の安全性と安定性の保証を拡張すること。
  • 模倣学習においてエキスパート方針を模倣する際、ポリシーの逸脱に起因する分布シフトが生じる閉ループ分布シフトを解消すること。
  • タスクの時間枠に依存しない、サンプル効率的でオンポリシー型の模倣学習アルゴリズムを構築し、証明可能な安全性と安定性を維持すること。
  • 状態フィードバックベースのエキスパートと同等の安全性保証を備えたセンシングベースの制御方針のデプロイを可能にすること。

提案手法

  • CMILeは、学習済みポリシーがエキスパートの最適化ベース制御方針と同一の安全性と安定性制約を満たすことを保証するための制約付きポリシー最適化フレームワークを用いる。
  • サンプル効率性とポリシー蒸留中のロバスト性を向上させるために、確率的ミキシング反復学習を統合する。
  • 非線形ロバスト制御理論を組み込み、トレーニング中に明示的に強制される安定性制約を定義する。
  • 模倣学習問題を、閉ループ安定性と安全性をハード制約として扱う制約付き最適化問題として定式化する。報酬としての扱いではなく、制約として扱う。
  • ポリシーの逸脱に起因する閉ループダイナミクスのモデル化により、エキスパートと模倣者間の分布シフトを最小限に抑える。
  • タスク時間枠に依存しないサンプル複雑度の上限を導出することで、長時間タスクへのスケーラビリティを実現する。

実験結果

リサーチクエスチョン

  • RQ1高周波数で動作する最適化ベース制御の安全性と安定性特性を、軽量で実行時効率の高いポリシーに蒸留することは可能か?
  • RQ2センシングベース制御において、模倣ポリシーがエキスパートから逸脱した場合に生じる閉ループ分布シフトをどのように解消できるか?
  • RQ3タスク時間枠に依存しない、証明可能な安全性と安定性保証を模倣学習で達成することは可能か?
  • RQ4非線形ロバスト制御は、分布シフトに起因する逸脱に対しても安定性を維持するように学習済みポリシーを制約する役割を果たすか?
  • RQ5確率的ミキシングを統合することで、安全な模倣学習におけるサンプル効率性とロバスト性はどのように向上するか?

主な発見

  • CMILeは、状態フィードバックベースのエキスパート制御方針と同等の安全性と安定性保証を満たす、センシングベースの制御方針を成功裏に学習した。
  • タスク時間枠に依存しないサンプル複雑度の上限を達成しており、長時間タスクへのスケーラビリティを示している。
  • 非線形ロバスト制御の制約を統合することで、ポリシーの逸脱に起因する分布シフトに対しても安定性を保証している。
  • この手法により、豊富なセンシング入力を持つ模倣学習において、閉ループ分布シフトが効果的に解消され、安全性と性能が維持された。
  • 広範な実験により、CMILeが、一般ハードウェア上で低コストな推論を可能にするとともに、エキスパートレベルの安全性を保持できることを示した。
  • 確率的ミキシングの導入により、特に分布シフトに起因する状況下でも収束性とロバスト性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。