[論文レビュー] Game representations for state constrained continuous time linear regulator problems
本稿は、凸状態制約を伴う連続時間線形二次調節器(LQR)問題を、バリア関数を二次関数の上界として表現することにより、ゲーム理論的再定式化を提案する。主な貢献は、制約付きLQR問題が非制約付き2人ゼロサムゲームに等価であることを示し、リッカティ型方程式を用いた状態フィードバック最適制御方策を可能にするとともに、計算可能性の観点から上ゲーム値と下ゲーム値の等価性を証明することにある。
A supremum-of-quadratics representation for convex barrier-type constraints is developed and applied within the context of a class of continuous time state constrained linear regulator problems. Using this representation, it is shown that a linear regulator problem subjected to such a convex barrier-type constraint can be equivalently formulated as an unconstrained two-player linear quadratic game. By demonstrating equivalence of the upper and lower values of this game, state feedback characterizations for the optimal policies of both players are developed. These characterizations are subsequently illustrated by example.
研究の動機と目的
- 連続時間線形二次調節器(LQR)問題に凸状態制約を組み込む際の課題に対処すること。これは標準的な二次構造を破り、非二次的で解きにくいハミルトニアン=ジャコビ=ベルマン(HJB)偏微分方程式を引き起こす。
- バリア関数の二次関数の上界としての表現を用いることで、凸緩和を導入し、次元の呪いと制約付きLQR問題における計算不能性を克服すること。
- 元の制約付きLQR問題と非制約付き2人線形二次ゲームとの間の等価性を確立し、最適制御合成にゲーム理論的手法を適用可能にする。
- ゲームにおける両プレイヤーの最適方策の状態フィードバック特徴付けを導出し、制約の満たされるとともに、元の問題の解に収束することを保証する。
提案手法
- 実数パラメータでインデックス付けられた二次ペナルティ関数族の上界として、凸バリア関数を表現し、状態依存の二次ペナルティにより非二次的制約を近似可能にする。
- 状態制約を厳密に満たすためにペナルティパラメータを無限大に発散させる「正確な」二次関数の上界表現を導入し、計算可能性を確保するための「近似版」を、有界なパラメータ区間を用いて定式化する。
- 制約付きLQR問題を非制約付き2人ゼロサムゲームに定式化し、最小化プレイヤーがシステムを制御し、最大化プレイヤーがペナルティパラメータを選択して制約を強制する。
- ゲームの上ゲーム値と下ゲーム値が等価であることを示し、値の存在を保証するとともに、動的計画法の適用を可能にする。
- ゲームのハミルトニアン=ジャコビ=ベルマン方程式から導かれる微分リッカティ方程式(DRE)を解くことで、両プレイヤーの状態フィードバック最適方策を導出する。
- 可測選択とフェンケル双対性を用いて、最適フィードバック則の存在を確立し、値関数の連続性と凸性を証明する。
実験結果
リサーチクエスチョン
- RQ1連続時間LQR問題における凸状態制約を、等価な非制約付き2人ゲームに再定式化できるか?
- RQ2バリア関数の二次関数の上界表現が、元の制約付き問題の最適値と軌道行動を保持するか?
- RQ3上ゲーム値と下ゲーム値の等価性を確立でき、値の存在を保証し、計算可能戦略の導出を可能にするか?
- RQ4ゲーム定式化における両プレイヤーの状態フィードバック最適制御方策をどのように導出できるか?
- RQ5ペナルティパラメータの上限を大きくするに従って、近似ゲーム定式化が正確な制約付きLQR問題にどのように収束するか?
主な発見
- 凸バリア関数の正確な二次関数の上界表現により、最適状態軌道が閉制約球内に拘束され、ほとんど確実に内部に存在することが保証される。
- 近似ゲーム定式化は、ペナルティパラメータの上限が無限大に発散するに従い、値関数および最適軌道の両面で正確な問題に収束する。
- 2人ゲームの上ゲーム値と下ゲーム値が等価であるため、値の存在が保証され、動的計画法による方策合成が可能になる。
- 両プレイヤーの最適フィードバック方策は、微分リッカティ方程式(DRE)の解を用いて明示的に特徴付けられ、計算が効率的に行える。
- ゲームの値関数は凸かつ下半連続であり、そのフェンケル変換が明示的に計算可能であり、バリア関数とペナルティパラメータ空間との間の関係が明確にされる。
- 制御プレイヤーの最適方策はDREの解に依存するが、対戦相の戦略は現在の状態に基づいてペナルティパラメータを選択し、制約の強制を保証する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。