Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Regret for Control of Time-Varying Dynamics

Paula Gradu, Elad Hazan|arXiv (Cornell University)|Jul 8, 2020
Advanced Bandit Algorithms Research参考文献 31被引用数 14
ひとこと要約

本稿では、時間変動する線形力学系に対して、任意の部分線形リグレットを持つ制御器を、部分線形の適応的リグレットを持つものに変換する、新規のメタアルゴリズムを提案する。オンライン凸最適化(メモリ付き)と新規の適応的リグレットバウンドを活用することで、制御器が変化するシステムの動的特性に動的に適合可能となり、非確率的環境においてほぼタイトなリグレットバウンドを達成する。

ABSTRACT

We consider the problem of online control of systems with time-varying linear dynamics. This is a general formulation that is motivated by the use of local linearization in control of nonlinear dynamical systems. To state meaningful guarantees over changing environments, we introduce the metric of {\it adaptive regret} to the field of control. This metric, originally studied in online learning, measures performance in terms of regret against the best policy in hindsight on {\it any interval in time}, and thus captures the adaptation of the controller to changing dynamics. Our main contribution is a novel efficient meta-algorithm: it converts a controller with sublinear regret bounds into one with sublinear {\it adaptive regret} bounds in the setting of time-varying linear dynamical systems. The main technical innovation is the first adaptive regret bound for the more general framework of online convex optimization with memory. Furthermore, we give a lower bound showing that our attained adaptive regret bound is nearly tight for this general framework.

研究の動機と目的

  • 非線形力学系の時間変動する動的特性を、局所的線形化を用いて制御する課題に対処すること。
  • 標準のリグレット指標が失敗する非定常環境におけるオンライン制御のパフォーマンス保証を確立すること。
  • 制御理論における変化する動的特性への適応能力を捉える意味のあるパフォーマンス指標として、適応的リグレットを導入すること。
  • 標準のリグレット最小化制御器を適応的リグレット最小化制御器に変換する効率的なメタアルゴリズムを設計すること。
  • メモリ付きオンライン凸最適化における適応的リグレットのほぼタイトな下界を確立すること。

提案手法

  • 複数のエキスパート制御器を維持するメタアルゴリズムを提案し、各制御器を代理損失関数上でオンライン勾配降下法で更新する。
  • 時間的複雑度を対数的におさめるために、階層的セットシステム $S_t$ を用いて制御器の重みを維持・更新する。
  • 各タイムステップでの制御選択をガイドするため、将来のパフォーマンスを推定するための代理代理コスト関数を採用する。
  • オンライン凸最適化(メモリ付き)の枠組みに適用し、この一般的な設定において初の適応的リグレットバウンドを導出する。
  • 任意の時間区間において最もパフォーマンスの良いエキスパートに制御を動的に移行させる、新規の重み更新ルールを導入する。
  • 各ステップで時変する線形化されたシステムの動的特性 $(A_t, B_t)$ を自動微分を用いて計算する。

実験結果

リサーチクエスチョン

  • RQ1非確率的環境下で、時間変動する線形力学系の動的特性に効果的に適応できる制御器を設計できるか?
  • RQ2オンライン制御におけるリグレット最小化を、変化するシステム行動への適応を捉えるように拡張できるか?
  • RQ3時間変動するシステムにおけるメモリ付きオンライン凸最適化の最適な達成可能な適応的リグレットバウンドは何か?
  • RQ4メタアルゴリズムは、標準のリグレット最小化制御器を部分線形の適応的リグレットを持つものに効率的に変換できるか?
  • RQ5導出された適応的リグレットバウンドは、対数的要因を除いてタイトか?

主な発見

  • 提案されたメタアルゴリズムは、時間変動する線形力学系に対して部分線形の適応的リグレットを達成し、変化する動的特性への効果的な適応を可能にする。
  • 本手法は、広範な意味を持つ一般的な枠組みとして、メモリ付きオンライン凸最適化における初の適応的リグレットバウンドを確立する。
  • ほぼタイトな下界が証明され、達成された適応的リグレットバウンドが、対数的要因を除いて最適であることが示された。
  • 実験では、非定常環境における時間変動する動的特性を持つ状況で、MARCメタアルゴリズムがGPC や iLQR などのベースライン制御器を上回る性能を示した。
  • アルゴリズムは各タイムステップで $O(\log T)$ 個の作業セットを維持し、動的制御選択にもかかわらず計算効率を保つ。
  • ハイパーパramータチューニングの結果、実験において $\eta = 0.05$ および $\sigma = 10^{-2}$ の設定で最適な性能が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。