Skip to main content
QUICK REVIEW

[論文レビュー] Online Learning for Receding Horizon Control with Provable Regret Guarantees.

Deepan Muthirayan, Jianjun Yuan|arXiv (Cornell University)|Nov 30, 2021
Advanced Bandit Algorithms Research参考文献 49被引用数 5
ひとこと要約

本稿では、時変コスト関数を伴う未知の線形動的システムを制御するための2つのオンラインリceding Horizon Control (RHC)アルゴリズム—Certainty Equivalence RHC (CE-RHC) および O-RHC—を提案する。標準的な安定性仮定の下で、CE-RHCは$\mathcal{O}(T^{2/3})$の動的レジーットを達成する。O-RHCは、安定性が真のシステムに対してのみ成り立つ場合にもこの保証を拡張するが、追加の計算コストを伴う。

ABSTRACT

We address the problem of learning to control an unknown linear dynamical system with time varying cost functions through the framework of online Receding Horizon Control (RHC). We consider the setting where the control algorithm does not know the true system model and has only access to a fixed-length (that does not grow with the control horizon) preview of the future cost functions. We characterize the performance of an algorithm using the metric of dynamic regret, which is defined as the difference between the cumulative cost incurred by the algorithm and that of the best sequence of actions in hindsight. We propose two different online RHC algorithms to address this problem, namely Certainty Equivalence RHC (CE-RHC) algorithm and Optimistic RHC (O-RHC) algorithm. We show that under the standard stability assumption for the model estimate, the CE-RHC algorithm achieves $\mathcal{O}(T^{2/3})$ dynamic regret. We then extend this result to the setting where the stability assumption hold only for the true system model by proposing the O-RHC algorithm. We show that O-RHC algorithm achieves $\mathcal{O}(T^{2/3})$ dynamic regret but with some additional computation.

研究の動機と目的

  • 未知の線形動的システムと時変コスト関数を伴うオンライン制御を扱う。
  • 完全なシステムモデルの知識が欠如する状況において、証明可能な動的レジーットの保証を達成するアルゴリズムを開発する。
  • 将来のコストのプレビューが限られている(固定長で、制御ホライズンに従って増加しない)条件下で動作する。
  • 安定性仮定が真のシステムモデルにのみ適用される状況に対しても、レジーットの保証を拡張する。
  • オンライン制御における、レジーット性能と計算コストのトレードオフをバランスさせる。

提案手法

  • 将来のコストの固定長プレビューを伴うオンラインリceding Horizon Control (RHC)フレームワーク内で制御問題を定式化する。
  • 推定されたシステムモデルと標準的なRHC最適化を用いて、Certainty Equivalence RHC (CE-RHC)アルゴリズムを設計する。
  • モデル推定が不安定な場合に対応するため、楽観的更新戦略を用いたOptimistic RHC (O-RHC)アルゴリズムを導入する。
  • 動的レジーットを性能指標として用い、累積コストを後悔視点での最良の行動シーケンスと比較する。
  • 推定モデルの安定性仮定の下でレジーットバウンドを導出する(CE-RHC)、および真のモデルの安定性仮定の下でレジーットバウンドを導出する(O-RHC)。
  • 標準的な線形システム理論とオンライン学習技術を用いて、モデル不確実性の下でも収束性と安定性を保証する。

実験結果

リサーチクエスチョン

  • RQ1システムモデルが未知であり、将来のコストのプレビューが固定長である状況下でも、オンラインRHCが証明可能な動的レジーットの保証を達成できるか?
  • RQ2モデル推定に対する標準的な安定性仮定の下で、オンラインRHCが達成可能な最良の動的レジーットは何か?
  • RQ3モデル推定が不安定であるが真のシステムは安定である場合にも、レジーットの保証を拡張できるか?
  • RQ4O-RHCにおける楽観的更新の追加計算コストは、レジーット性能にどのように影響するか?
  • RQ5時変システムにおけるオンラインRHCにおいて、レジーット性能と計算複雑性の間にはどのようなトレードオフがあるか?

主な発見

  • 標準的なモデル推定の安定性仮定の下で、CE-RHCアルゴリズムは$\mathcal{O}(T^{2/3})$の動的レジーットを達成する。
  • O-RHCアルゴリズムは、同様の$\mathcal{O}(T^{2/3})$の動的レジーットバウンドを達成するが、安定性仮定が真のシステムモデルにのみ適用されるより弱い仮定の下で成立する。
  • O-RHCアルゴリズムは、弱い仮定の下でもレジーットの保証を維持するために、CE-RHCよりも追加の計算を要する。
  • プレビュー長が制御ホライズンに従って増加しない限られた将来コストプレビューの設定において、提案されたアルゴリズムは有効である。
  • 結果として、モデル不確実性を伴う時変線形システムにおけるオンラインRHCで、証明可能なレジーットバウンドが達成可能であることが示された。
  • フレームワークは、完全なシステムモデルの知識がなくても、プレビュー長が増加しない状況でも、ロバストなオンライン制御手法を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。