Skip to main content
QUICK REVIEW

[論文レビュー] Learning convex bounds for linear quadratic control policy synthesis

Jack Umenberger, Thomas B. Schön|arXiv (Cornell University)|Jun 1, 2018
Reinforcement Learning in Robotics参考文献 30被引用数 7
ひとこと要約

本論文は、未知のシステムパラメータの事後分布上の期待LQRコストを最小化することで、限られたデータからロバストな線形二次制御方策を学習するためのベイジアン最適化手法を提案する。逐次凸プログラミングと主要化最小化原理を用いることで、局所的収束性とロバスト安定性を保証し、シミュレーションおよび実世界の倒立振子実験において、ワーストケース法やノーマル法を上回る性能を示した。データ効率が高く、システム次元にかかわらず一貫した安定化を達成した。

ABSTRACT

Learning to make decisions from observed data in dynamic environments remains a problem of fundamental importance in a number of fields, from artificial intelligence and robotics, to medicine and finance. This paper concerns the problem of learning control policies for unknown linear dynamical systems so as to maximize a quadratic reward function. We present a method to optimize the expected value of the reward over the posterior distribution of the unknown system parameters, given data. The algorithm involves sequential convex programing, and enjoys reliable local convergence and robust stability guarantees. Numerical simulations and stabilization of a real-world inverted pendulum are used to demonstrate the approach, with strong performance and robustness properties observed in both.

研究の動機と目的

  • 未知の線形ダイナミカルシステムにおける制御方策を、保証されたロバスト安定性を伴いながら、データ効率よく学習する手法の開発。
  • システムパラメータの事後分布上の期待LQRコストを最適化し、性能とロバスト性のバランスをとる。
  • 確率的不確実性の定量化を活用することで、ワーストケースロバスト制御の過剰な保守性を克服する。
  • 凸近似を用いて、学習済み方策の信頼性ある局所的収束性と安定性を保証する。
  • シミュレーションおよび実世界の制御タスクにおいて、優れた性能とロバスト性を示す。

提案手法

  • 本手法は、観測データから得られるシステムパラメータの不確実性をベイジアンフレームワークでモデル化し、事後分布を形成する。
  • 主要化最小化(MM)原理を適用して、期待LQRコストの凸上界を構築し、逐次凸最適化を可能にする。
  • これらの凸近似は半正定値プログラミングにより解かれるため、計算の実行可能性と局所的収束性が保証される。
  • 事後不確実性集合から導かれる凸制約を組み込むことで、ロバスト安定性が保証される。
  • モンテカルロサンプリングを事後分布から行い、期待コストの近似と妥当なシステムモデル上の安定性の検証に用いる。
  • 本手法は、シミュレーションおよび実機器実験において、ワーストケース法、ノーマル法、および$H_2/H_\infty$ベースの手法と比較された。

実験結果

リサーチクエスチョン

  • RQ1モデル不確実性下でもロバスト安定性を保証しつつ、期待LQR性能を最適化する制御方策を学習可能か?
  • RQ2高次元システムにおいて、期待コスト最適化の性能と安定性は、ワーストケースまたはノーマル方策合成と比べてどのように異なるか?
  • RQ3ベイジアン不確実性定量化は、制御方策学習におけるデータ効率をどの程度向上させるか?
  • RQ4データが少ない場合やシステム次元が増加した場合、本手法は妥当性と安定性を維持できるか?
  • RQ5実世界のハードウェアにおいて、本手法の制御入力とシステム応答は、ベースライン手法と比べてどのように異なるか?

主な発見

  • テストされたすべてのシステム次元において、95%事後信頼区間内のサンプルモデルの100%が安定化された。$n_x = 12$の場合、ワーストケース法では46%のケースで失敗した。
  • $n_x = 3$の場合、$M \geq 800$のモンテカルロサンプルを用いることで、中央値の不安定率が0.10%にまで低下し、有限サンプル下でもロバスト性が確認された。
  • 回転式倒立振子での実世界実験において、本手法はベースライン手法よりも低いLQRコストと小さな制御信号の大きさを達成した。特にデータが少ない状況で顕著であった。
  • ワーストケース法および$H_2/H_\infty$法が高不確実性のため実行不能となった場合でも、本手法は妥当性と安定性を維持した。
  • 性能が急速に収束し、実機器ではたった10回のロールアウトで安定化が達成された。これは高いデータ効率を示している。
  • $n_x = 12$の場合、最適方策と比較してサブオプティマル性が0.27%以内に収まり、ロバスト性と妥当性を両立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。