Skip to main content
QUICK REVIEW

[論文レビュー] Improper Learning for Non-Stochastic Control

Max Simchowitz, Karan Singh|arXiv (Cornell University)|Jan 25, 2020
Advanced Control Systems Optimization参考文献 42被引用数 17
ひとこと要約

本稿では、ノイズ除去された観測値を用いた新しいコントローラーのパrametrizationを提案し、オンライン勾配降下法を適用することで、部分観測付きの非確率的制御においてサブリニアなレグレットを達成する。既知のシステムに対しては初めて√Tのレグレットバウンドを確立し、未知のシステムに対してはT^{2/3}を達成。半アドバーシャルノイズ下では最適なpoly(log T)のレグレットを達成し、すべての安定化線形コントローラーと比較する。

ABSTRACT

We consider the problem of controlling a possibly unknown linear dynamical system with adversarial perturbations, adversarially chosen convex loss functions, and partially observed states, known as non-stochastic control. We introduce a controller parametrization based on the denoised observations, and prove that applying online gradient descent to this parametrization yields a new controller which attains sublinear regret vs. a large class of closed-loop policies. In the fully-adversarial setting, our controller attains an optimal regret bound of $\sqrt{T}$-when the system is known, and, when combined with an initial stage of least-squares estimation, $T^{2/3}$ when the system is unknown; both yield the first sublinear regret for the partially observed setting. Our bounds are the first in the non-stochastic control setting that compete with \emph{all} stabilizing linear dynamical controllers, not just state feedback. Moreover, in the presence of semi-adversarial noise containing both stochastic and adversarial components, our controller attains the optimal regret bounds of $\mathrm{poly}(\log T)$ when the system is known, and $\sqrt{T}$ when unknown. To our knowledge, this gives the first end-to-end $\sqrt{T}$ regret for online Linear Quadratic Gaussian controller, and applies in a more general setting with adversarial losses and semi-adversarial noise.

研究の動機と目的

  • 従来の最適コントローラーが事前に計算できない非確率的制御(悪意のあるダイナミクス、損失、部分的状態観測)に対処すること。
  • 静的フィードバック政策ではなく、安定化線形動的コントローラーの広いクラスと比較するレグレット最小化コントローラーを開発すること。
  • 非確率的制御における先行研究を統合・改善し、確率的および悪意のあるノイズが混在する設定へと拡張すること。
  • 未知のシステムにおける古典的線形二次ガウス(LQG)設定において、タイトなレグレットバウンドを達成すること。ここでは、先行研究が√Tのレグレット保証を欠いていた。

提案手法

  • ヨウラパラメトリゼーションに基づくコントローラーのパラメトリゼーションを提案。システムを「自然のy(Nature’s y)」、すなわちゼロ制御下での観測値として再表現する。
  • ノイズ除去された観測値から導出される凸パラメトリゼーションである、摂動応答制御(DRC)フレームワークを導入。
  • DRCパラメトリゼーションにオンライン勾配降下法を適用し、勾配応答コントローラー(DRC-GD)を構築する。
  • 2段階アプローチを採用:未知のシステムに対しては初期段階で最小二乗推定を実施し、その後DRC空間上でオンライン最適化を実行。
  • マルティンゲールの集中不等式およびサブガウス型尾部バウンドを用いて、悪意のあるおよび半アドバーシャルノイズ下での高確率的レグレットバウンドを導出。
  • 損失差の再帰的分解と勾配・状態推定誤差の精密な制御により、レグレットバウンドを導出。

実験結果

リサーチクエスチョン

  • RQ1システムのダイナミクスが未知である部分観測付き非確率的制御において、サブリニアなレグレットを達成できるか?
  • RQ2提案されたコントローラーは、完全に悪意のあるおよび半アドバーシャルノイズの両設定で最適なレグレットレートを達成するか?
  • RQ3静的フィードバック政策ではなく、安定化線形動的コントローラーの全クラスと比較できるレグレットバウンドを達成できるか?
  • RQ4部分観測設定下で、既知のシステムの場合に√Tのレグレットバウンドがタイトであるか?
  • RQ5システムが既知の場合に、半アドバーシャルノイズ下でpoly(log T)のレグレットを達成できるか?

主な発見

  • DRC-GDコントローラーは、完全に悪意のある条件下で既知のシステムに対してはÕ(√T)のレグレットを達成し、これはタイトであり、部分観測設定下で初めてのレグレットバウンドである。
  • 未知のシステムに対しては、Õ(T^{2/3})のレグレットを達成し、これは部分観測下で初めてのサブリニアなレグレットバウンドである。
  • 半アドバーシャルノイズ(確率的+悪意のある)下では、システムが既知の場合にpoly(log T)のレグレットを達成し、未知の場合には√Tのレグレットを達成する。両者とも最適である。
  • レグレットバウンドは、従来の静的フィードバック政策よりもはるかに包括的な安定化線形動的コントローラーの全クラスに対して有効である。
  • 本フレームワークは、未知のシステムを伴うオンラインLQG制御において、初のエンドツーエンドの√Tレグレットバウンドを提供する。
  • 結果は一般の凸損失関数および悪意のある摂動へと拡張可能であり、ロバストネスと一般性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。