Skip to main content
QUICK REVIEW

[論文レビュー] Making Non-Stochastic Control (Almost) as Easy as Stochastic

Max Simchowitz|arXiv (Cornell University)|Jun 10, 2020
Advanced Bandit Algorithms Research参考文献 30被引用数 8
ひとこと要約

本稿では、非確率的制御設定において、敵対的摂動に適応したオンラインニュートンステップの応用により、最良の既知の確率的LQRにおけるレギュレートレートと一致する最適な $\widetilde{\mathcal{O}}(T^{1/2})$ レギュレートを達成する、新しいオンライン制御アルゴリズムを提示する。任意の強凸コスト、部分観測、完全に敵対的なノイズを扱い、オンラインLQRにおける確率的性質がレギュレートレートを改善しないことを証明する。

ABSTRACT

Recent literature has made much progress in understanding \emph{online LQR}: a modern learning-theoretic take on the classical control problem in which a learner attempts to optimally control an unknown linear dynamical system with fully observed state, perturbed by i.i.d. Gaussian noise. It is now understood that the optimal regret on time horizon $T$ against the optimal control law scales as $\widetildeΘ(\sqrt{T})$. In this paper, we show that the same regret rate (against a suitable benchmark) is attainable even in the considerably more general non-stochastic control model, where the system is driven by \emph{arbitrary adversarial} noise (Agarwal et al. 2019). In other words, \emph{stochasticity confers little benefit in online LQR}. We attain the optimal $\widetilde{\mathcal{O}}(\sqrt{T})$ regret when the dynamics are unknown to the learner, and $\mathrm{poly}(\log T)$ regret when known, provided that the cost functions are strongly convex (as in LQR). Our algorithm is based on a novel variant of online Newton step (Hazan et al. 2007), which adapts to the geometry induced by possibly adversarial disturbances, and our analysis hinges on generic "policy regret" bounds for certain structured losses in the OCO-with-memory framework (Anava et al. 2015). Moreover, our results accomodate the full generality of the non-stochastic control setting: adversarially chosen (possibly non-quadratic) costs, partial state observation, and fully adversarial process and observation noise.

研究の動機と目的

  • オンラインLQR設定における確率的制御と非確率的制御の間のレギュレートレートのギャップを埋めること。
  • 最適な $\widetilde{\mathcal{O}}(T^{1/2})$ レギュレートレートが、独立同分布のガウスノイズだけでなく、敵対的摂動のもとでも達成可能であることを示すこと。
  • 任意の強凸コスト、部分状態観測、敵対的プロセスおよび観測ノイズを想定した、完全な一般性を満たす効率的なアルゴリズムの開発。
  • オンライン制御における根本的なレギュレートレートがノイズの確率的性質に依存しないことを確立し、従来のノイズ構造が性能を向上させるという仮定に挑戦すること。
  • オンラインニュートンステップを、制御における構造的で記憶依存性のある損失にまで拡張し、OCO-with-memoryフレームワークへの適用を拡大すること。

提案手法

  • 敵対的摂動が制御ダイナミクスに与える幾何的性質に適応する、オンラインニュートンステップ(Ons)の新しい変種を提案する。
  • 制御問題を記憶効果を持つ構造的損失依存更新の系列としてモデル化するため、OCO-with-memoryフレームワークを用いる。
  • レギュレートと安定性のバランスを取るために正則化パラメータ $\lambda$ を選択した修正Onsアルゴリズムを適用し、$\mu$-レギュレートバウンドを保証する。
  • OcoAM(オンライン制御における適応的記憶)を用いて損失変換を行い、制御目的を指数的凸性とリプシッツ連続性を満たす損失にマッピングする。
  • 指数的凸性およびリプシッツ条件の下でOnsに既知の理論的保証を適用し、それらを制御設定に適合させる。
  • 問題の仮定の下で、OcoAM損失が必要な正則性条件(例:$\tau$-指数的凸性)を満たすことを確立する。

実験結果

リサーチクエスチョン

  • RQ1オンラインLQRにおける最適な $\widetilde{\mathcal{O}}(\sqrt{T})$ レギュレートレートが、敵対的摂動を伴う非確率的制御設定でも達成可能か?
  • RQ2システムに確率的ノイズが存在する場合、非確率的ノイズに比べてレギュレートレートが根本的に改善されるか?
  • RQ3オンラインニュートンステップは、線形ダイナミクスを伴う非確率的制御における記憶依存的・構造的損失に対応できるか?
  • RQ4システムダイナミクスが未知の場合と既知の場合の両方において、非確率的制御のための最良のレギュレートバウンドは何か?
  • RQ5OCO-with-memoryフレームワークは、一般の非確率的制御問題におけるレギュレート最小化アルゴリズムの設計に、どの程度活用可能か?

主な発見

  • 提案されたアルゴリズムは、システムダイナミクスが未知の非確率的制御設定においても、$\widetilde{\mathcal{O}}(\sqrt{T})$ レギュレートを達成し、最良の確率的LQRレートと一致する。
  • システムダイナミクスが既知の場合、アルゴリズムは $\mathrm{poly}(\log T)$ レギュレートを達成し、再び確率的設定における最良の既知のバウンドと一致する。
  • レギュレートバウンドは、任意の強凸コスト、部分状態観測、完全に敵対的なプロセスおよび観測ノイズという完全な一般性のもとで達成される。
  • 解析により、OcoAM損失変換が $\frac{\alpha}{L_{\mathrm{eff}}^2}$-指数的凸性および $R_H L_{\mathrm{eff}}$-リプシッツ連続性を満たすことが保証され、きめ細やかなレギュレート制御が可能になる。
  • アルゴリズムの性能は、$\mu$-レギュレートバウンド $\lesssim (R_0 D^2 T \mu^2)^{1/3} + R_0$ によって支配され、ここで $R_0 = \max\{GD, 1/\tau\} \cdot d \log T$ であり、最適なパrameterチューニングの下で $\sqrt{T}$ スケーリングが回復される。
  • 結果として、オンラインLQRにおける確率的性質がレギュレートレートを改善しないことが示された。同様の最適な $\sqrt{T}$ レートが敵対的摂動のもとでも達成可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。