Skip to main content
QUICK REVIEW

[論文レビュー] Approximate Robust Control of Uncertain Dynamical Systems

Edouard Leurent, Y. Blanco|arXiv (Cornell University)|Mar 1, 2019
Advanced Control Systems Optimization参考文献 22被引用数 17
ひとこと要約

本稿では、不確実な非線形力学系における近似ロバスト制御のための2つの実行可能手法を提案する:有限のあいまいさ集合に対してはサンプリングベースのプランナ、連続な集合に対しては区間予測子に基づく保守的緩和法。これらの手法により、最悪ケース性能を最大化することで自律走行における安全で高性能な制御が可能となり、実験ではモデル不確実性が存在する中でも近似オракル性能に近いロバストな方策が達成された。

ABSTRACT

This work studies the design of safe control policies for large-scale non-linear systems operating in uncertain environments. In such a case, the robust control framework is a principled approach to safety that aims to maximize the worst-case performance of a system. However, the resulting optimization problem is generally intractable for non-linear systems with continuous states. To overcome this issue, we introduce two tractable methods that are based either on sampling or on a conservative approximation of the robust objective. The proposed approaches are applied to the problem of autonomous driving.

研究の動機と目的

  • 従来のロバスト制御が非実行可能であるため、不確実な力学系を有する大規模非線形システムにおける安全な制御の課題に対処すること。
  • 連続的かつ非線形なシステムにおける正確なロバスト制御の非実行可能性を克服し、近似的で計算効率の良い手法を導入すること。
  • モデル不確実性下でも性能バウンダリーを保証するロバストな方策学習を可能にすること。これは自律走行などの安全が求められる応用において重要である。
  • 離散的および連続的あいまいさ集合に適用可能な手法を開発し、ハイブリッドな不確実性構造をサポートすること。
  • 実際の交通状況を再現した高速道路走行環境におけるシミュレーションを通じて、実用的有効性を示すこと。

提案手法

  • 有限のあいまいさ集合に対しては、全行動シーケンスを探索する楽観的サンプリングベースのプランナ(アルゴリズム1)を用い、単純な後悔の上界を提供する。
  • 連続なあいまいさ集合に対しては、区間予測子を用いてロバスト方策評価問題の保守的緩和を構築する。
  • 保守的近似における一貫性と安全性を保証するため、状態の区間予測を計画された方策に条件付けする。
  • パラメータ化された決定論的モデル $ s' = T_\theta(s,a) $ を用い、$ \theta \in \Theta \subset \mathbb{R}^p $ とする。ここで $ \Theta $ は不確実性を表すコンact集合である。
  • ロバスト制御の目的関数を $ \max_\pi \min_T v^T_\pi $ と定式化し、あいまいさ集合全体で最悪ケースの期待報酬を最大化する。
  • これらの手法を、エゴ車両制御とマルチエージェント交通ダイナミクス(運動学的および行動モデルでモデル化)を有するシミュレーテッド高速道路走行環境に統合する。

実験結果

リサーチクエスチョン

  • RQ1連続的状態と不確実な力学系を有する非線形システムに対して、計算効率的で近似可能なロバスト制御手法を設計できるか?
  • RQ2正確なロバスト制御が非実行可能である状況において、モデル不確実性下でも性能保証を維持する方法は何か?
  • RQ3連続的あいまいさ集合におけるロバスト制御に区間予測子を用いる際の、保守的と性能のトレードオフは何か?
  • RQ4サンプリングベースのプランニングは、収束保証が得られる有限のあいまいさ設定において、ロバスト方策を効果的に近似できるか?
  • RQ5人間が運転する車両の不確実な行動が存在する現実世界のシナリオにおいて、ロバスト方策はノーマル方策やオーケストラ方策と比べてどのように異なるか?

主な発見

  • サンプリングベースのプランナ(アルゴリズム1)は、最悪ケース報酬8.99、平均報酬10.78±0.34を達成し、オーケストラの最悪ケース9.83および平均10.84±0.16に近づいた。
  • 区間予測子に基づく手法(アルゴリズム2)は、最悪ケース報酬7.88、平均報酬10.73±0.61を達成し、両方の指標でノーマルプランナーより優れた性能を示した。
  • 離散的あいまいさ設定では、ロバストプランナーがノーマルプランナー(最悪ケース2.09)を著しく上回り、オーケストラ性能に近づいた。
  • 連続的あいまいさ設定では、ロバストプランナー(最悪ケース7.88)がノーマルプランナー(最悪ケース1.99)を著しく上回り、モデルバイアスに対して強い耐性を示した。
  • 両手法とも性能バウンダリーを提供した:サンプリング手法は漸近的一貫性を保証し、区間手法は真の方策性能の下界を提供した。
  • 結果は、保守的近似を用いたロバスト制御が、不完全なモデル知識が存在する状況でも、不確実な交通環境における安全で高性能な意思決定を可能にすることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。