[論文レビュー] Sample Complexity of Linear Quadratic Gaussian (LQG) Control for Output Feedback Systems
この論文は、動的特性が未知で状態が部分的に観測可能なシステムにおけるロバストな線形二次ガウス(LQG)コントローラーを学習するためのエンドツーエンドのサンプル複雑度バウンドを確立する。非漸近的システム同定とH-infinityバウンド付き推定誤差、および入出力パrameterization(IOP)を用いたロバストコントローラー設計を組み合わせることで、モデル誤差に対してLQG性能が線形に劣化するのを実現し、オープンループ安定系における全状態LQR学習の最適スケーリングと一致する。
This paper studies a class of partially observed Linear Quadratic Gaussian (LQG) problems with unknown dynamics. We establish an end-to-end sample complexity bound on learning a robust LQG controller for open-loop stable plants. This is achieved using a robust synthesis procedure, where we first estimate a model from a single input-output trajectory of finite length, identify an H-infinity bound on the estimation error, and then design a robust controller using the estimated model and its quantified uncertainty. Our synthesis procedure leverages a recent control tool called Input-Output Parameterization (IOP) that enables robust controller design using convex optimization. For open-loop stable systems, we prove that the LQG performance degrades linearly with respect to the model estimation error using the proposed synthesis procedure. Despite the hidden states in the LQG problem, the achieved scaling matches previous results on learning Linear Quadratic Regulator (LQR) controllers with full state observations.
研究の動機と目的
- システムの動的特性が未知で状態が部分的に観測される状況下で、LQGコントローラーを学習するための理論的サンプル複雑度保証のギャップを埋めること。
- 内部状態の再構築を必要とせず、モデル不確実性下でも安定性と性能を保証するロバスト制御合成手順を開発すること。
- 隠れた状態と出力フィードバックの課題にもかかわらず、全状態LQR学習と同等のサンプル複雑度スケーリングを達成すること。
- 定量化されたモデル不確実性を用いて、凸的で取り扱いやすいロバストコントローラー設計を可能にする入出力パrameterization(IOP)を活用すること。
提案手法
- 有限長の入出力トレースから非漸近的システム同定技術を用いてシステムモデルを推定する。
- システム不一致の非漸近的H-infinityノルムバウンドを用いて推定誤差を定量化する。
- 入出力パrameterization(IOP)を適用し、すべての安定化コントローラーを凸集合として表現することで、凸最適化によるロバスト制御設計を可能にする。
- 推定モデルとそのH-infinity不確実性バウンドを用いてロバストLQGコントローラーを設計し、閉ループ安定性を保証する。
- 得られたコントローラーのサブ最適性ギャップが、モデル推定誤差に比例して線形に増大することを証明する。
- システム同定誤差バウンドとロバスト制御性能保証を組み合わせることで、エンドツーエンドのサンプル複雑度バウンドを確立する。
実験結果
リサーチクエスチョン
- RQ1動的特性が未知で出力フィードバックが用いられる状況下でも、全状態LQR学習と同等の性能を達成するLQG制御のサンプル複雑度バウンドを達成できるか?
- RQ2真のシステムモデルが未知で、出力トレースしか観測できない状況下でも、ロバストな安定性と性能を保証できるか?
- RQ3部分観測LQG問題において、モデル推定誤差とコントローラーのサブ最適性の最適なトレードオフは何か?
- RQ4非漸近的システム同定と効果的に組み合わせることで、IOPを用いた凸的ロバスト制御合成が、タイトな性能バウンドをもたらすか?
主な発見
- 提案されたロバストコントローラー合成手順により、LQG性能の劣化がモデル推定誤差に対して線形に増大し、サブ最適性ギャップがO(ε)となることが保証された。ここでεは推定誤差のH-infinityノルムである。
- オープンループ安定系では、本手法が全状態LQR学習と同等のサンプル複雑度スケーリングO(N⁻¹)を達成し、文献で知られている最良の結果と一致する。
- 入出力パrameterization(IOP)の使用により、凸最適化によるロバストコントローラー設計が可能となり、合成手順の取り扱いやすさとスケーラビリティが向上する。
- システム推定誤差の非漸近的H-infinityバウンドは、システム同定誤差とコントローラー性能劣化を結びつける上で極めて重要である。
- 内部状態空間表現の再構築を必要としないため、入出力データを直接用いてコントローラー学習が可能になる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。