Skip to main content
QUICK REVIEW

[論文レビュー] The Nonstochastic Control Problem

Elad Hazan, Sham M. Kakade|arXiv (Cornell University)|Nov 27, 2019
Advanced Bandit Algorithms Research参考文献 26被引用数 9
ひとこと要約

本稿は、敵対的摂動および凸損失関数の下で、未知の線形力学系に対する非確率的制御問題を導入し、最良の線形ポリシーに対する $O(T^{2/3})$ のレグレットを達成する効率的なアルゴリズムを提案する。この手法は、敵対的システム同定とオンライン凸最適化を組み合わせることで、完全に敵対的な摂動に対しても、システム行列を回復し、適応的制御を実現する。

ABSTRACT

We consider the problem of controlling an unknown linear dynamical system in the presence of (nonstochastic) adversarial perturbations and adversarial convex loss functions. In contrast to classical control, the a priori determination of an optimal controller here is hindered by the latter's dependence on the yet unknown perturbations and costs. Instead, we measure regret against an optimal linear policy in hindsight, and give the first efficient algorithm that guarantees a sublinear regret bound, scaling as T^{2/3}, in this setting.

研究の動機と目的

  • 敵対的で非確率的な摂動と未知のダイナミクスを伴うシステムにおけるレジリエンス制御の欠如に対処すること。
  • 最良の線形ポリシーを後悔基準として用いる、新しい制御フレームワーク「非確率的制御」を定義すること。
  • システム行列 $A$, $B$ や摂動 $w_t$ の事前知識がなくとも、サブ線形レグレットを達成する効率的なアルゴリズムを開発すること。
  • 従来の最小二乗法では不可能であった、敵対的ノイズ下でのシステム同定のオープンな問題を解決すること。

提案手法

  • 学習者がオンラインで制御入力 $u_t$ を選択し、最良の線形ポリシーに対する後悔を最小化する、革新的な制御フレームワークを提案する。
  • 敵対的摂動下での状態軌道から、システム行列 $A$ と $B$ を回復するための敵対的システム同定を採用する。
  • 安定性とモーメント回復を確保するため、制御入力を $u_t = -\mathbb{K}x_t + \eta_t$ の形($\eta_t$ は平均ゼロの確率的ベクトル)で定義する。
  • 行列濃度不等式(Matrix Azuma)を用いて、観測された状態-制御ペアから $(A')^j B$ のモーメントを推定する。
  • 線形システムの摂動解析を用いて、モーメントの推定誤差に基づき、回復された行列 $\hat{A}, \hat{B}$ の誤差をバインドする。
  • 推定されたシステムダイナミクス上でオンライン凸最適化を組み合わせ、サブ線形レグレットを達成する適応的制御を生成する。

実験結果

リサーチクエスチョン

  • RQ1システムダイナミクスと摂動の両方が敵対的である場合、未知の線形システムの制御においてサブ線形レグレットを達成できるか?
  • RQ2独立同分布のノイズ仮定なしに、敵対的摂動下でもシステム行列 $A$ と $B$ を正確に同定できるか?
  • RQ3敵対的コスト関数と未知のダイナミクスの下で、最良の線形ポリシーに対する後悔を競える効率的アルゴリズムを設計できるか?
  • RQ4レグレットバウンドは時間 $T$ に対してサブ線形にスケーリングするか? もしそうならば、最適レートは何か?

主な発見

  • 提案アルゴリズムは、最良の線形ポリシーに対する $O(\textrm{poly}(\texttt{natural-parameters})T^{2/3})$ のレグレットを達成し、これは $T$ に対してサブ線形である。
  • システム同定は $A^\prime = A - B\mathbb{K}$ のモーメント回復により実現され、誤差バウンドは $T_0$(回復に使用するステップ数)に依存する。
  • $T_0 = O(kmn^2\kappa^{10}\gamma^{-2}W^2\varepsilon_{A,B}^{-2}\log(kmn\delta^{-1}))$ のとき、$A^\prime$ と $B$ の回復は確率 $1-\delta$ で保証される。ここで $\varepsilon_{A,B}$ はターゲット誤差である。
  • 制御ポリシー下で、状態ノルムは $O(\kappa^3\gamma^{-1}W)$、制御ノルムは $O(\kappa^4\gamma^{-1}W)$ で有界である。
  • コストの最適ポリシーからの偏差は、1ステップあたり $O(Gn\kappa^8\gamma^{-2}W^2)$ で有界である。
  • レグレットバウンドは、主要項においてシステムの次元に依存せず、$T^{2/3}$ のみにスケーリングされる。これは既知の複雑度境界のもとで最適である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。