Skip to main content
QUICK REVIEW

[論文レビュー] Logarithmic Regret for Adversarial Online Control

Dylan J. Foster, Max Simchowitz|arXiv (Cornell University)|Feb 29, 2020
Advanced Bandit Algorithms Research参考文献 37被引用数 22
ひとこと要約

この論文は、敵対的摂動下でのオンライン線形二次制御のための新規アルゴリズムであるRiccatitronを紹介する。最適なオフライン制御則の特徴付けを活用し、近似の優位関数を用いた遅延オンライン学習に問題を還元することで、対数的レジットを達成する。システムの動的特性と二次コストが既知の下で、$Ó(\log^3 T)$のレジットを達成し、確率的仮定なしに完全に敵対的シーケンスに対して初めての結果をもたらす。

ABSTRACT

We introduce a new algorithm for online linear-quadratic control in a known system subject to adversarial disturbances. Existing regret bounds for this setting scale as $\sqrt{T}$ unless strong stochastic assumptions are imposed on the disturbance process. We give the first algorithm with logarithmic regret for arbitrary adversarial disturbance sequences, provided the state and control costs are given by known quadratic functions. Our algorithm and analysis use a characterization for the optimal offline control law to reduce the online control problem to (delayed) online learning with approximate advantage functions. Compared to previous techniques, our approach does not need to control movement costs for the iterates, leading to logarithmic regret.

研究の動機と目的

  • 敵対的摂動が存在する状況でも、確率的でない最悪ケースの摂動に対しても、低レジットを達成する証明可能に効率的なオンライン制御アルゴリズムの開発。
  • 既存の$Ó(\sqrt{T})$のレジット境界と、敵対的オンライン制御における対数的レジットの理論的可能領域との間のギャップを埋める。
  • 線形オンライン制御における対数的レジットが達成可能な条件を確立する、特にシステム行列$A$と$B$が既知である場合に焦点を当てる。
  • 異なるポリシーが異なる状態軌道を通過するという、オンライン制御における軌道不一致の課題を、近似の優位関数を用いた問題の再定式化によって軽減する。
  • フレームワークを、内部状態を持つ制御器やトラッキング損失関数を含むより一般的なベンチマークへと拡張する。

提案手法

  • 最適なオフライン制御則をリッカティ方程式と閉ループダイナミクスを用いて特徴付け、オンライン制御問題を遅延オンライン学習問題に還元する。
  • 現在のポリシーと最適ポリシーのコスト差をモデル化するために、近似の優位関数を用いることで、効率的なレジット最小化を実現する。
  • 反復の移動コストを制御する必要がなくなるという、従来の手法とは顕著に異なる点であり、これにより$\sqrt{T}$ではなく対数的レジットが可能になる。
  • システム行列とリッカティ解に対する安定性保証と作用素ノルムの境界を用いて、時間ステップ間での誤差伝播を制御する。
  • リッカティ反復の収束速度を$P_\infty$に利用し、有限区間と無限区間の最適ポリシーの差をバウンディングする。
  • スペクトル的性質に基づき、閉ループシステムの性質に依存して、適切に調整された正則化と安定性しきい値のスケームを用いて、時間経過に伴う誤差蓄積を有界に保つ。

実験結果

リサーチクエスチョン

  • RQ1摂動が完全に敵対的である場合、つまり確率的または準敵対的でない場合に、オンライン線形二次制御で対数的レジットを達成できるか。
  • RQ2対数的レジットを達成するために必要な構造的仮定(例:$A$、$B$が既知、二次コスト)は何か。また、それが十分条件であるか。
  • RQ3動的オンライン制御における軌道不一致を、レジット最小化問題の再定式化によってどのように軽減できるか。
  • RQ4持続的励起性やi.i.d.ノイズの仮定を課さずに、$\sqrt{T}$を越えるレジット境界の改善は可能か。
  • RQ5最適なオフライン制御則の構造が、対数的レジットを達成する効率的なオンライン学習を可能にする役割は何か。

主な発見

  • 提案されたRiccatitronアルゴリズムは、システムの動的特性と二次コストが既知の下で、敵対的摂動下のオンライン線形二次制御において$\mathcal{O}(\log^3 T)$のレジットを達成する。
  • これは、摂動に確率的仮定を必要とせず、完全に敵対的シナリオにおいても多項式対数的レジットを達成する最初のアルゴリズムである。
  • 摂動シーケンスが敵対的に適応的に選ばれても、このレジット境界は成立し、強いロバストネスを示す。
  • 従来の手法とは異なり、ポリシー反復の移動コストを制御する必要がなく、これが対数的レジットを可能にする主な要因である。
  • 解析により、$A$と$B$が既知である場合にのみ対数的レジットが可能であり、それらが未知の場合、i.i.d.ガウスノイズ下でもミニマックス意味で不可能であることが示された。
  • アルゴリズムは、内部状態を持つ制御器やトラッキング損失関数を含むより一般的なベンチマークへと拡張可能であり、同様のレジット保証が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。