[論文レビュー] Black-Box Control for Linear Dynamical Systems
本稿は、敵対的摂動と凸コスト関数の下で、1つの軌道におけるサブラインアーレグレットを達成する、未知の線形時不変(LTI)システムに対する最初の効率的なブラックボックス制御アルゴリズムを提示する。一般の凸コスト関数に対しては、$2^{\tilde{O}({\mathcal{L}})} + \tilde{O}(\mathrm{poly}({\mathcal{L}})T^{2/3})$ のレグレットバウンドを達成し、二次コスト関数に対しては $2^{\tilde{O}({\mathcal{L}})} + \tilde{O}(\mathrm{poly}({\mathcal{L}})\sqrt{T})$ を達成する。また、システムサイズ $\mathcal{L}$ に対する指数的依存性が、一致する $2^{\Omega(\mathcal{L})}$ の下界により、避けがたいことを証明している。
We consider the problem of controlling an unknown linear time-invariant dynamical system from a single chain of black-box interactions, with no access to resets or offline simulation. Under the assumption that the system is controllable, we give the first efficient algorithm that is capable of attaining sublinear regret in a single trajectory under the setting of online nonstochastic control. This resolves an open problem on the stochastic LQR problem, and in a more challenging setting that allows for adversarial perturbations and adversarially chosen and changing convex loss functions. We give finite-time regret bounds for our algorithm on the order of $2^{ ilde{O}(\mathcal{L})} + ilde{O}( ext{poly}(\mathcal{L}) T^{2/3})$ for general nonstochastic control, and $2^{ ilde{O}(\mathcal{L})} + ilde{O}( ext{poly}(\mathcal{L}) \sqrt{T})$ for black-box LQR, where $\mathcal{L}$ is the system size which is an upper bound on the dimension. The crucial step is a new system identification method that is robust to adversarial noise, but incurs exponential cost. To complete the picture, we investigate the complexity of the online black-box control problem, and give a matching lower bound of $2^{Ω(\mathcal{L})}$ on the regret, showing that the additional exponential cost is inevitable. This lower bound holds even in the noiseless setting, and applies to any, randomized or deterministic, black-box control method.
研究の動機と目的
- リセットやオフラインシミュレーションへのアクセスなしに、未知のLTIシステムに対する効率的なブラックボックス制御のオープンな問題を解決すること。
- 敵対的摂動と変化する凸コスト関数の下で、1つのオンライン軌道におけるサブラインアーレグレットを達成するアルゴリズムを開発すること。
- システムの動的特性について事前の知識がなくとも、後悔が最良のコントローラーに比べて競争可能な有限時間の後悔バウンドを確立すること。
- 任意のブラックボックス制御手法において、システムサイズ $\mathcal{L}$ に対する指数的依存性が避けがたいかを証明すること。
提案手法
- 敵対的ノイズに対してロバストな新しいシステム同定手法を提案し、1つの軌道からの正確なシステム動的特性の推定を可能にする。
- 状態ノルムを指数関数的に増大させるために、正規直交行列 $V$ と制御ゲイン $Q$ の反復的構築を用い、システムの可観測性および可制御性の同定を保証する。
- $H_2$、$H_\infty$、最適線形コントローラーを含む、干渉行動コントローラークラスを比較政策として採用する。
- 過去の状態とコストに基づいて行動を適応的に選択する制御方策を導入し、ポリシー空間における投影オンライン勾配降下法を用いる。
- 状態ノルムの指数的増大を活用して同定可能性を保証する一方で、推定誤差と制御性能の新たな解析を通じて、後悔バウンドを導出する。
- 情報理論的下界として、$2^{\Omega(\mathcal{L})}$ の一致する下界を確立し、任意の決定的または確率的ブラックボックス手法において、指数的コストが避けがたいかを証明する。
実験結果
リサーチクエスチョン
- RQ1リセットなし、リセットなしにブラックボックスアクセスのみを有する未知のLTIシステムにおいて、効率的なアルゴリズムがサブラインアーレグレットを達成可能か。
- RQ21つの軌道のみを用いて、敵対的摂動の下でもシステム動的特性をロバストに同定可能か。
- RQ3ブラックボックス制御の根本的複雑度は、システムサイズ $\mathcal{L}$ に対してどのように定式化可能か。また、$\mathcal{L}$ に対する指数的依存性は避けられるか。
- RQ4提案されたアルゴリズムは、後悔バウンドが、後から最良の干渉行動コントローラーに比べて競争可能か。
- RQ5ブラックボックス制御の指数的コストが本質的かつ避けがたいかを示すタイトな下界を確立可能か。
主な発見
- 提案されたアルゴリズムは、一般の凸コスト関数に対して $\tilde{O}(\mathrm{poly}(\mathcal{L})T^{2/3})$ の後悔を達成し、システム同定に起因する追加の $2^{\tilde{O}(\mathcal{L})}$ 項が存在する。
- 二次コスト関数(ブラックボックスLQR)の特別な場合においては、後悔バウンドが $2^{\tilde{O}(\mathcal{L})} + \tilde{O}(\mathrm{poly}(\mathcal{L})\sqrt{T})$ に改善され、確率的設定における既知の最良のバウンドと一致する。
- アルゴリズムは効率的であり、多項式時間で実行可能であり、LTIシステムに対する効率的ブラックボックス制御のオープンな問題を解決する。
- 非確率的設定において、後悔に対する一致する下界 $2^{\Omega(\mathcal{L})}$ が証明され、システムサイズに対する指数的依存性が避けがたいかが示された。
- 下界はノイズなしの場合にも成り立ち、すべての決定的および確率的ブラックボックス制御手法に適用可能であり、問題の根本的限界を確立する。
- システム同定手法は敵対的ノイズに対してロバストであり、1つの軌道からの同定可能性を保証するため、ノルムが指数的に増大する状態軌道を構築することに依存する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。