Skip to main content
QUICK REVIEW

[論文レビュー] Certainty Equivalent Perception-Based Control

Sarah Dean, Benjamin Recht|arXiv (Cornell University)|Aug 27, 2020
Control Systems and Identification参考文献 43被引用数 4
ひとこと要約

本稿では、ノイズが混在する動的サンプリングによるセンサデータから、非パrametricなカーネル回帰を用いて逆感知マップを学習する、確信度等価の感知ベース制御フレームワークを提案する。ウェイポイント追従における部分最適性の有限時間収束レートを確立し、部分最適性が $ \sim (\sigma/T)^{1/(p+4)} $ のように減少することを示している。ここで $ T $ はサンプル数、$ p $ は測定部分空間の次元を表す。

ABSTRACT

In order to certify performance and safety, feedback control requires precise characterization of sensor errors. In this paper, we provide guarantees on such feedback systems when sensors are characterized by solving a supervised learning problem. We show a uniform error bound on nonparametric kernel regression under a dynamically-achievable dense sampling scheme. This allows for a finite-time convergence rate on the sub-optimality of using the regressor in closed-loop for waypoint tracking. We demonstrate our results in simulation with simplified unmanned aerial vehicle and autonomous driving examples.

研究の動機と目的

  • モデル化されていない非線形センサを備えたフィードバック制御系に対して、性能および安全性の保証を提供すること。
  • 状態推定が複雑で高次元の観測に依存する自律システムにおけるセンサの不確実性の課題に対処すること。
  • 学習された閉ループ制御系が有界な部分最適性を達成するための、感知マップを学習するために必要なサンプル複雑性を分析すること。
  • 測定部分空間の密な、動的に行えるサンプリングが、非パrametric回帰の均一収束を可能にすることを示すこと。
  • 実際の自律走行車両およびUAVシミュレーションにおける、学習された感知マップの閉ループ性能を評価すること。

提案手法

  • ノイズを含む補助センサを用いて、観測値 $ z $ を状態部分空間 $ Cx $ に写像する逆感知マップ $ h $ の学習を支援する。
  • 動的に行える密なサンプリング方式によって収集された $ T $ 個の訓練サンプルから、非パrametricカーネル回帰(KRR)を用いて $ h $ を推定する。
  • 連続的な逆マップと有界なノイズの仮定の下で、回帰推定値に一様な点ごとの誤差バインディングを課す。
  • 学習された制御系と最適制御系の間の部分最適性ギャップの有限時間収束レートを導出する。そのスケーリングは $ (\sigma/T)^{1/(p+4)} $ である。
  • 確信度等価の制御則を適用し、線形出力フィードバック制御フレームワーク内において、学習されたマップ $ \widehat{h}(z) $ を真の状態推定値として扱う。
  • 有界な摂動とセンサノイズの下で、基準軌道からの最悪ケースのずれを最小化するロバスト制御定式化を採用する。

実験結果

リサーチクエスチョン

  • RQ1学習可能で、性能保証が可能な感知マップを、閉ループ制御に使用できるか?
  • RQ2非パrametric回帰器を用いて感知を行う場合、ウェイポイント追従において有界な部分最適性を保証するためには、どの程度のサンプル複雑性が必要か?
  • RQ3測定部分空間の密な、動的に行えるサンプリングが、感知マップの均一収束に与える影響は何か?
  • RQ4訓練データがスパースまたは不均一に分布している場合、非パrametric予測器(例:NW、KRR)が閉ループ制御で失敗するメカニズムは何か?
  • RQ5データスパarsity下で、SLAMのような教師ありでないまたは半教師ありの手法が、教師あり非パrametric学習より、感知ベース制御において優れた性能を示せるか?

主な発見

  • 学習された感知マップを用いた確信度等価制御系の部分最適性は、$ \sim (\sigma/T)^{1/(p+4)} $ のレートで減少する。ここで $ \sigma $ はノイズレベル、$ T $ は訓練サンプル数を表す。
  • 動的に行える密なサンプリング方式の下で、非パrametricカーネル回帰に対する一様な点ごとの誤差バインディングが確立され、ロバストネスの保証が可能になる。
  • 閉ループ追従に失敗するのは、基準軌道が訓練データがスパースな領域にシステムを誘導する場合に発生し、特にNWやKRRのような非パrametric予測器において顕著である。
  • SLAMベースの感知は、オンラインマッピングにラベルなしデータを活用するため、教師あり非パrametric手法に比べて分布外領域に対して優れたロバストネスを示す。
  • サンプリング方式が測定部分空間の十分なカバレッジを保証する限り、感知マップが不完全であっても、安定性と有界な部分最適性が保証される。
  • UAVおよび自律走行車両タスクにおける数値的評価から、密なサンプリングと学習マップの使用が、安定的かつ正確なウェイポイント追従を可能にすることが確認された。一方、スパースなサンプリングは不安定性と失敗を引き起こす。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。