Skip to main content
QUICK REVIEW

[論文レビュー] Robust Regression for Safe Exploration in Control

Anqi Liu, Guanya Shi|arXiv (Cornell University)|Jun 13, 2019
Gaussian Processes and Bayesian Inference参考文献 43被引用数 9
ひとこと要約

本稿では、モデルベース制御における安全な探索のための深層頑健回帰フレームワークを提案する。特に、共変量シフト下での不確実性を明示的に定量化することで、証明可能に安全かつ情報豊富なデータ収集を可能にする。高速ドローン着陸や逆パendulum制御といった困難な非線形制御タスクにおいて、調整が少ないにもかかわらずガウス過程ベースの手法を上回る性能を発揮する。

ABSTRACT

We study the problem of safe learning and exploration in sequential control problems. The goal is to safely collect data samples from operating in an environment, in order to learn to achieve a challenging control goal (e.g., an agile maneuver close to a boundary). A central challenge in this setting is how to quantify uncertainty in order to choose provably-safe actions that allow us to collect informative data and reduce uncertainty, thereby achieving both improved controller safety and optimality. To address this challenge, we present a deep robust regression model that is trained to directly predict the uncertainty bounds for safe exploration. We derive generalization bounds for learning, and connect them with safety and stability bounds in control. We demonstrate empirically that our robust regression approach can outperform the conventional Gaussian process (GP) based safe exploration in settings where it is difficult to specify a good GP prior.

研究の動機と目的

  • データ収集が安全である一方でモデルの精度を向上させる必要がある非線形制御システムにおける安全な探索の課題に対処する。
  • 事前分布の指定が不十分な高次元・非線形環境において、ガウス過程の限界を克服する。
  • 逐次的データ収集中に一般的に見られる共変量シフト下で、ダイナミクスモデルの不確実性を頑健回帰を用いて定量化する。
  • 不確実性定量化を制御理論と統合し、軌道追従の安定性と安全性の境界を導出する。
  • 過剰なハイパーパrameterチューニングを伴わずに、探索と安全のバランスを取った効率的で適応的なデータ収集を可能にする。

提案手法

  • 未モデル化ダイナミクスを表す残差項 d(q, ˙q) を含む混合ダイナミクスモデルを用いて制御問題を定式化する。
  • 深層ニューラルネットワークを用いて、共変量シフト下での不確実性バウンドを明示的に学習する、頑健回帰を実行する。
  • スペクトル正規化と頑健推定技術を用いて、分布シフト下での一般化性能と安定性を向上させる。
  • 頑健回帰モデルの一般化と摂動バウンドを導出し、それらを制御の安定性と追従誤差に関連付ける。
  • 不確実性推定を制御則に統合し、安定性と安全性を保証する。収束を強制するために合成変数 s = ˙q − ˙qr を用いる。
  • 不確実性と安全制約に基づき、有限のプールから軌道を選択する安全な探索アルゴリズムを設計し、データ収集中のリスクを最小化する。

実験結果

リサーチクエスチョン

  • RQ1逐次的探索中にデータ分布がシフトする状況下で、ダイナミクスモデルにおける不確実性を信頼性を持って定量化する方法は何か?
  • RQ2事前分布が不正確または誤って指定された状況下でも、深層頑健回帰がガウス過程を上回る性能を発揮できるか?
  • RQ3頑健回帰から得られる不確実性バウンドを、制御の安定性と追従誤差の保証に正式に結びつける方法は何か?
  • RQ4共変量シフトは、制御用途の深層ダイナミクスモデルにおける一般化性能と頑健性にどのような影響を与えるか?
  • RQ5頑健回帰に基づくアプローチは、非線形システムにおいて安全性を維持したまま、より能動的かつ情報豊富なデータ収集を可能にするか?

主な発見

  • 提案手法は、逆パendulumの追従タスクと高速ドローン着陸タスクの両方において、GPベースの手法よりも優れた性能を達成した。
  • GPベースの手法に比べて、特にカーネルや事前分布の選定に敏感である点を考慮すると、調整の手間が著しく削減された。
  • 頑健回帰モデルから導出された一般化と摂動バウンドは、直接的に制御の安定性と追従誤差バウンドに反映された。
  • 本手法はエピソード的学習における共変量シフトを効果的に処理でき、全軌道にわたる信頼性の高い不確実性定量化を実現した。
  • 実験的結果から、限られたデータでもシステムの境界付近(例:高速ドローン着陸)で安全に探索でき、墜落を回避した。
  • スペクトル正規化を用いた頑健回帰は、高次元・非線形な環境下で、標準的なGPモデルよりも優れた不確実性キャリブレーションを達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。