Skip to main content
QUICK REVIEW

[論文レビュー] Online Optimization with Memory and Competitive Control

Guanya Shi, Yiheng Lin|arXiv (Cornell University)|Feb 13, 2020
Optimization and Search Problems参考文献 39被引用数 20
ひとこと要約

本稿では、過去 $ p $ 回の意思決定に依存し、事前に完全に特定できないコスト関数を伴う構造的記憶を有するオンライン凸最適化のための新しいアルゴリズム、Optimistic Regularized Online Balanced Descent (OOBDO) を提案する。本手法は次元に依存しない定数の競争比を達成し、1ステップを超える記憶を持つ問題において初めてのこのような結果をもたらし、オンライン制御と関連づけることで、広範なクラスの制御問題に対して定数競争比を有するポリシーを構築する。

ABSTRACT

This paper presents competitive algorithms for a novel class of online optimization problems with memory. We consider a setting where the learner seeks to minimize the sum of a hitting cost and a switching cost that depends on the previous $p$ decisions. This setting generalizes Smoothed Online Convex Optimization. The proposed approach, Optimistic Regularized Online Balanced Descent, achieves a constant, dimension-free competitive ratio. Further, we show a connection between online optimization with memory and online control with adversarial disturbances. This connection, in turn, leads to a new constant-competitive policy for a rich class of online control problems.

研究の動機と目的

  • 1ステップを超える記憶を持つオンライン最適化における定数競争比アルゴリズムの欠落を埋める。
  • 行動選択の前にコスト関数を完全に知っているという制限的な仮定を排除し、Smoothed Online Convex Optimization (SOCO) を一般化する。
  • 記憶付きオンライン最適化とアドバーシャル摂動下のオンライン制御との間の理論的リンクを確立する。
  • 広範なクラスのオンライン制御問題に対して定数競争比を有するポリシーを開発し、先行研究の制限を超える。

提案手法

  • 過去 $ p $ 個の行動に依存し、事前に正確に特定できない損失関数を伴う、構造的記憶を有するオンライン凸最適化という新しい問題設定を提示する。
  • 遅延的かつ部分的な情報に対処するために、楽観主義と正則化を組み込んだ、Optimistic Regularized Online Balanced Descent (OOBDO) アルゴリズムを導入する。
  • 次元や問題サイズに依存しない定数競争比を達成することを示すために、競争比分析フレームワークを用いる。
  • 線形ダイナミクスとアドバーシャル摂動を伴う広範なクラスのオンライン制御問題を、構造的記憶付き OCO 問題に還元する。
  • 最適化設定から制御設定への競争保証を転送する非自明な還元技術を用いる。
  • ノイズ系列の明示的構成を用いて、最良の線形コントローラと真のオフライン最適コントローラとの間の性能差を評価する。

実験結果

リサーチクエスチョン

  • RQ1未来のコストが完全に分かっていない状況下でも、1ステップを超える記憶を持つオンライン最適化に対して定数競争比を達成できるアルゴリズムを設計できるか?
  • RQ2アドバーシャル摂動を伴うオンライン制御問題において、最良の静的線形コントローラと真のオフライン最適コントローラとの間の理論的性能差は何か?
  • RQ3記憶付きオンライン最適化とオンライン制御との間の関係を形式化することで、一般の制御系に対して定数競争比を有するポリシーを得られるか?
  • RQ4記憶長 $ p $ やシステムダイナミクスなどのシステムパラメータに応じて、提案アルゴリズムの競争比はどのようにスケーリングするか?
  • RQ5アドバーシャル摂動を伴う線形制御系において、最良の線形コントローラと真のオフライン最適コントローラとの間の最悪ケース性能比は何か?

主な発見

  • 提案された OOBDO アルゴリズムは、問題の次元や記憶長 $ p $ に依存しない、構造的記憶付きオンライン凸最適化において定数競争比を達成する。
  • 競争比は普遍定数で有界であり、多様な問題インスタンスにわたるロバストネスを示している。
  • 定常摂動の場合は、$ T \to \infty $ のとき、競争比は $ \frac{q + (a-1)^2}{4} \cdot \frac{q + (a-1)^2}{q} $ に近づき、システムパラメータに依存することが示された。
  • 振動する摂動 $ w_t = (-1)^t w $ の場合、競争比は $ \frac{q + (a-1)^2}{4} \cdot \frac{q + (a+1)^2}{q} $ で有界であり、定常の場合と比較して顕著に大きくなることがある。
  • 最良の線形コントローラと真のオフライン最適コントローラとの間のギャップは、任意に大きくなり得るため、静的レジレットベンチマークの限界を示している。
  • オンライン制御から構造的記憶付き OCO 問題への還元により、アドバーシャル摂動を伴う広範なクラスの線形制御系に対して定数競争比を有するポリシーを構築でき、逆行列を必要としたり、摂動を完全に知っている必要があるという先行研究の制限を超える。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。