Skip to main content
QUICK REVIEW

[論文レビュー] Probabilistic Robust Linear Quadratic Regulators with Gaussian Processes

Alexander von Rohr, Matthias Neumann-Brosig|arXiv (Cornell University)|May 17, 2021
Gaussian Processes and Bayesian Inference参考文献 27被引用数 10
ひとこと要約

本論文は、ガウス過程(GP)ベースの線形化動的モデルの事後分布の全情報を活用する確率的ロバスト線形二次調節器(LQR)を提案する。これは、最悪ケースの不確実性バウンドではなく、事後分布を用いる。GPの不確実性分布下での期待性能を最適化するとともに、事前に指定された確率で安定性を保証することで、最悪ケースロバスト制御および確信等価設計よりも顕著に優れた制御性能を達成し、信用区間を通じた形式的な確率的ロバスト性保証を提供する。

ABSTRACT

Probabilistic models such as Gaussian processes (GPs) are powerful tools to learn unknown dynamical systems from data for subsequent use in control design. While learning-based control has the potential to yield superior performance in demanding applications, robustness to uncertainty remains an important challenge. Since Bayesian methods quantify uncertainty of the learning results, it is natural to incorporate these uncertainties into a robust design. In contrast to most state-of-the-art approaches that consider worst-case estimates, we leverage the learning method's posterior distribution in the controller synthesis. The result is a more informed and, thus, more efficient trade-off between performance and robustness. We present a novel controller synthesis for linearized GP dynamics that yields robust controllers with respect to a probabilistic stability margin. The formulation is based on a recently proposed algorithm for linear quadratic control synthesis, which we extend by giving probabilistic robustness guarantees in the form of credibility bounds for the system's stability.Comparisons to existing methods based on worst-case and certainty-equivalence designs reveal superior performance and robustness properties of the proposed method.

研究の動機と目的

  • ガウス過程からの確率的不確実性を組み込むことで、学習ベース制御における性能とロバスト性のトレードオフを解消すること。
  • GPベースの動的モデルにおける最悪ケースロバスト制御手法の過剰な保守性を克服すること。
  • 期待性能を最適化するとともに、確率的安定性保証を満たす制御則合成手法を開発すること。
  • ユーザーが事前に指定可能な形式的な信用区間を用いて、閉ループ安定性の保証を提供すること。
  • 全事後分布を活用することで、最悪ケースや確信等価アプローチよりも優れた性能が得られることを実証すること。

提案手法

  • システム動的モデルのガウス過程モデルを線形化し、GPの事後分布によってパrameter化された線形時不変(LTI)システムの族を導出する。
  • GPの事後分布におけるシステムパrameterの期待コストを最適化するロバストLQR合成問題を定式化する。
  • 決定論的最悪ケースバウンドの代わりに、GP事後分布から導出される確率的信用区間を用いることで、性能とロバスト性の原理的トレードオフを可能にする。
  • 最近のLQR合成アルゴリズムを拡張し、確率的ロバスト性制約を組み込み、ユーザーが定めた信頼水準で閉ループシステムが安定することを保証する。
  • 事後分布のサンプリングに基づく近似を用いて制御則を合成し、期待性能と安定性バウンドの効率的計算を可能にする。
  • 閉ループシステム行列の固有値半径に関する信用区間を通じて、形式的な確率的ロバスト性保証を提供する。

実験結果

リサーチクエスチョン

  • RQ1最悪ケースバウンドに依存するのではなく、GPモデルの全事後分布を活用することで、学習ベース制御における制御性能を向上させることができるか?
  • RQ2GPベースの動的モデルを用いる場合に、事前に指定された確率で閉ループ安定性を形式的に保証する方法は何か?
  • RQ3GP事後分布下での期待性能を最適化することで、最悪ケースや確信等価設計よりも優れた実証的性能が得られるか?
  • RQ4実際のシステムにおいて、データ量とモデル精度の変化に伴い、本手法の性能はどのようにスケーリングするか?
  • RQ5従来のロバスト制御アプローチに比べ、GPベースの設定において本手法はより低い保守性でロバスト性を達成できるか?

主な発見

  • 合成系において、提案された確率的ロバスト(PR)制御則は、最悪ケースロバスト(R)および確信等価(CE)制御則よりも期待二次コストにおいて優れた性能を示し、特に3および5ラップアウトの条件下で顕著であった。
  • 回転パンドulumのシミュレーションでは、PR制御則がCEおよびR制御則よりも優れた平均性能を達成し、100%の実行可能性と保証された安定性を示した。
  • PR合成のすべての実行可能なインスタンスが安定な制御則を生成したため、確率的ロバスト性保証の妥当性が裏付けられた。
  • 合成系における8ラップアウトの条件下で、PR制御則は真の非線形システム用に設計された制御則と同等の性能を達成した。これは、高い精度と効率性を示している。
  • 最悪ケースロバスト制御に比べ、本手法は顕著に保守性を低減し、事前に定義された信頼水準で安定性を維持しながら、より高い期待性能を達成した。
  • 性能の向上は、小さな、事前に指定された不安定確率を伴うが、その確率は形式的に境界付けられ、ユーザーが制御可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。