[論文レビュー] Regret Minimization in Partially Observable Linear Quadratic Control
本稿では、未知のダイナミクスを有する部分的に観測可能な線形二次コントロールにおけるレギュレーション最小化のための、探索後に決定するアルゴリズムであるExpCommitを提案する。MarkovパラメータをHo-Kalmanアルゴリズムにより推定し、不確実性の面前での楽観主義(optimism in the face of uncertainty)を適用することで、ExpCommitは$ ilde{/mathcal{O}}(T^{2/3})$という非線形レギュレーションバウンドを達成し、この設定において初めての結果である。
We study the problem of regret minimization in partially observable linear quadratic control systems when the model dynamics are unknown a priori. We propose ExpCommit, an explore-then-commit algorithm that learns the model Markov parameters and then follows the principle of optimism in the face of uncertainty to design a controller. We propose a novel way to decompose the regret and provide an end-to-end sublinear regret upper bound for partially observable linear quadratic control. Finally, we provide stability guarantees and establish a regret upper bound of $ ilde{\mathcal{O}}(T^{2/3})$ for ExpCommit, where $T$ is the time horizon of the problem.
研究の動機と目的
- システムのダイナミクスが事前に未知である場合の部分的に観測可能な線形二次コントロールにおけるレギュレーション最小化の課題に対処すること。
- 累積コストの最適コントローラーからの偏差を最小化するために、探索と活用のバランスを取るアルゴリズムを設計すること。
- 潜在的状態推定誤差が存在するにもかかわらず、非線形のままである有限時間におけるレギュレーション上界を確立すること。
- 推定されたシステムパラメータから合成されたコントローラーの安定性保証を提供すること。
- 平均コストLQG制御におけるベルマン最適性方程式に基づく、新しいレギュレーション分解法を導入すること。
提案手法
- ExpCommitは二段階構造を採用する:ガウスノイズ入力を用いたデータ収集とシステムMarkovパラメータの推定を行う探索フェーズ。
- 探索中、非漸近的システム同定技術を用いて、推定されたMarkovパラメータの周囲に高確率の信頼集合を構築する。
- 決定フェーズでは、不確実性の面前での楽観主義(OFU)の原則を適用し、信頼集合内から最も楽観的なコントローラーを選択する。
- 安定かつ部分最適なコントローラーを保証するために、推定されたMarkovパラメータをHo-Kalman実現化アルゴリズムを用いて処理する。
- 平均コストLQG制御のベルマン最適性方程式を用いた、性能差の分析に適した新しいレギュレーション分解を導出する。
- 技術的ツールとして、自己正規化マルティングールバウンド、カバーイング・アーギュメント、およびサブガウス型集中不等式を用い、推定誤差とレギュレーション誤差を制御する。
実験結果
リサーチクエスチョン
- RQ1未知のダイナミクスを有する部分的に観測可能な線形二次コントロールにおいて、非線形のレギュレーションバウンドを達成できるか?
- RQ2潜在的状態推定誤差を有する部分観測系において、不確実性の面前での楽観主義を効果的に適用できるか?
- RQ3LQG制御において、レギュレーションスケーリングの観点から、探索と活用の最適なトレードオフは何か?
- RQ4推定されたMarkovパラメータから設計されたコントローラーに対して、有限時間の安定性保証を確立できるか?
- RQ5モデル不確実性を伴う平均コストLQG制御を分析するための、新たなレギュレーション分解技術は何か?
主な発見
- ExpCommitは、$\tilde{\mathcal{O}}(T^{2/3})$というレギュレーション上界を達成し、未知のダイナミクスを有する部分的に観測可能な線形二次コントロールにおいて、初めての非線形レギュレーションバウンドである。
- アルゴリズムは、モデル不確実性が存在する中でも、推定されたMarkovパラメータから合成されたコントローラーの安定性を保証する。
- ベルマン最適性方程式に基づくレギュレーション分解技術により、モデル推定誤差に起因するコストギャップを正確に定量化できる。
- 非漸近的システム同定を用いて、Markovパラメータの高確率信頼集合を構築することで、信頼性の高いOFUベースのコントローラー選択が可能になる。
- Ho-Kalmanアルゴリズムを用いたシステム実現により、推定モデルが一貫性があり、安定化可能であることが保証される。
- 自己正規化バウンドや行列ノルムのカバーイング・アーギュメントを含む、高度な集中不等式が理論的保証を支える。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。