Skip to main content
QUICK REVIEW

[論文レビュー] Online Optimal Control with Affine Constraints

Yingying Li, Subhro Das|arXiv (Cornell University)|Oct 10, 2020
Advanced Bandit Algorithms Research参考文献 47被引用数 4
ひとこと要約

本稿では、有界な摂動下でアフィン状態およびアクション制約を伴う線形システムに対する、オンライン最適制御のための新規なオンライン勾配降下法(OGD-BZ)を提案する。OGD-BZは、すべての時刻で制約を強制的に満たすことを保証し、政策レジーットの上界を$\tilde{O}(\sqrt{T})$に抑え、敵対的コスト変動下でも非線形レジーットと硬い制約満たしの両面で理論的保証を持つ最初のアルゴリズムである。

ABSTRACT

This paper considers online optimal control with affine constraints on the states and actions under linear dynamics with bounded random disturbances. The system dynamics and constraints are assumed to be known and time-invariant but the convex stage cost functions change adversarially. To solve this problem, we propose Online Gradient Descent with Buffer Zones (OGD-BZ). Theoretically, we show that OGD-BZ with proper parameters can guarantee the system to satisfy all the constraints despite any admissible disturbances. Further, we investigate the policy regret of OGD-BZ, which compares OGD-BZ's performance with the performance of the optimal linear policy in hindsight. We show that OGD-BZ can achieve a policy regret upper bound that is the square root of the horizon length multiplied by some logarithmic terms of the horizon length under proper algorithm parameters.

研究の動機と目的

  • 敵対的に変化する凸コストを同時に最小化し、有界な確率的摂動があっても硬い制約の満たしを保証するオンライン制御アルゴリズムの設計。
  • 時間変動する制約付き制御設定において、非線形政策レジーットとロバスト制約満たしの両面で理論的保証を提供するという、従来の研究におけるギャップを埋める。
  • 最適化フレームワーク内でのバッファゾーンの設計を通じて、制約のロバスト性とレジーット性能のトレードオフを明示的に特徴づける。

提案手法

  • ロバスト最適化と非制約的オンライン制御の技術を用いて、制約付きオンライン最適制御問題を時系列に依存するコストと制約を持つ等価なオンライン凸最適化(OCO)問題に変換する。
  • 問題変換中に生じる近似誤差を補償し、摂動下でもロバストな実行可能性を確保するために、バッファゾーンを導入して制約集合を厳しくする。
  • 変換されたOCO問題にオンライン勾配降下(OGD)アルゴリズムを適用し、OGD-BZアルゴリズムを導出する。
  • 状態およびアクション変数におけるアフィン制約を扱うために、絶対値を含む不等式制約の再定式化を採用する。
  • バッファゾーンのサイズによる保守的度合いとレジーット性能のバランスを取るパラメータ化された探索空間を採用する。
  • レジーットと実行可能性の保証を確立するために、主要な行列のフロベニウスノルムと勾配ノルムの理論的上限を導出する。

実験結果

リサーチクエスチョン

  • RQ1オンライン制御アルゴリズムは、有界で敵対的な摂動下でも、非線形政策レジーットを達成しながら硬い制約の満たしを保証できるか?
  • RQ2アフィン制約を伴うオンライン制御において、制約のロバスト性とレジーット性能のトレードオフを形式的に特徴づけ、制御することは可能か?
  • RQ3制約の満たしを保証するが、可能なアクション空間をあまり制限しない最適なバッファゾーンの設計は何か?

主な発見

  • 適切に選ばれたバッファゾーンパラメータのもとで、OGD-BZは、$\bar{w}$で有界な摂動があっても、すべての時刻で状態およびアクション制約を満たす。
  • 適切なアルゴリズムパラメータと仮定のもとで、OGD-BZの政策レジーットは$\tilde{O}(\sqrt{T})$で有界であり、これはホライズン長$T$に対して非線形である。
  • レジーットの上限はシステムの次元と摂動の上限に依存するが、$\delta_1$が$\bar{w}$の逆数に依存するにもかかわらず、勾配上限$G_f$の2次スケーリングのおかげで、$L\delta_1$は$\bar{w}$に関して線形のままである。
  • アルゴリズムは明示的に制約のロバスト性とレジーット性能のトレードオフを実現する:大きなバッファゾーンは制約の満たしを向上させるが、レジーットを増加させる。逆に、小さなバッファゾーンはレジーットを小さくするが、制約の満たしを弱める。
  • 理論的分析により、OGD-BZの実行可能集合が緩和された制約集合$\Gamma_\epsilon$に含まれており、最小の制約違反マージンが$\epsilon_*$より下限づけられていることが示された。
  • ヘシアンに類似た行列$\bm{M}$および双対変数$\bm{Y}^x, \bm{Y}^u, \bm{Z}$のフロベニウスノルムは$\delta_1 = \Theta(\sqrt{mn} + \sqrt{k_c})$で有界であり、これがレジーットの上限に寄与している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。