Skip to main content
QUICK REVIEW

[論文レビュー] Non-stationary Online Learning with Memory and Non-stochastic Control

Peng Zhao, Yan, Yu-Hu|arXiv (Cornell University)|Feb 7, 2021
Advanced Bandit Algorithms Research参考文献 55被引用数 13
ひとこと要約

本稿では、メモリを伴うオンライン凸最適化(OCO with Memory)に対する、切替コストを明示的に制御する切替コストに配慮したオンラインアンサンブルを用いて、最適な動的ポリシーのリグレットを達成する、新しいオンライン学習アルゴリズムを提案する。この手法により、時間変動するポリシーを伴う非確率的オンライン制御のための、初めての理論的保証付きの競合可能な制御則が実現され、時間の長さ、非定常性、メモリ長の観点からサブリニアなリグレットが達成される。

ABSTRACT

We study the problem of Online Convex Optimization (OCO) with memory, which allows loss functions to depend on past decisions and thus captures temporal effects of learning problems. In this paper, we introduce dynamic policy regret as the performance measure to design algorithms robust to non-stationary environments, which competes algorithms' decisions with a sequence of changing comparators. We propose a novel algorithm for OCO with memory that provably enjoys an optimal dynamic policy regret in terms of time horizon, non-stationarity measure, and memory length. The key technical challenge is how to control the switching cost, the cumulative movements of player's decisions, which is neatly addressed by a novel switching-cost-aware online ensemble approach equipped with a new meta-base decomposition of dynamic policy regret and a careful design of meta-learner and base-learner that explicitly regularizes the switching cost. The results are further applied to tackle non-stationarity in online non-stochastic control (Agarwal et al., 2019), i.e., controlling a linear dynamical system with adversarial disturbance and convex cost functions. We derive a novel gradient-based controller with dynamic policy regret guarantees, which is the first controller provably competitive to a sequence of changing policies for online non-stochastic control.

研究の動機と目的

  • 非定常環境における静的ポリシーのリグレットの限界を克服するため、より厳しい性能指標として動的ポリシーのリグレットを導入すること。
  • 時間変動する比較基準(comparator)の下で最適なリグレットバウンドを達成する、メモリを伴うオンライン凸最適化のためのオンライン学習アルゴリズムを設計すること。
  • メモリ依存の損失関数における動的リグレット最小化の主要な課題である、オンラインアンサンブルにおける切替コストの制御。
  • フレームワークをオンライン非確率的制御に拡張し、時間変動するポリシーと比較可能な、初めての動的ポリシーのリグレット保証付き制御則を提供すること。
  • 時間の長さ、非定常性、メモリ長の観点から、提案アルゴリズムの理論的保証を確立すること。

提案手法

  • 動的ポリシーのリグレットの新しいメタベース分解を導入し、リグレットをメタ・ラーナーとベース・ラーナーの成分に分離する。
  • メタ・ラーナーが意思決定の累積的移動を明示的に正則化する、切替コストに配慮したオンラインアンサンブルを設計する。
  • 適切に調整された正則化スキームを用いて、リグレットと切替コストのバランスを取る、新しいメタ・ラーナーを採用する。
  • OCO with Memoryにおけるメモリ制約を尊重しながら、局所的な損失関数に適応するベース・ラーナーを採用する。
  • 勾配ベースの制御則を導出することで、フレームワークをオンライン非確率的制御に適用し、動的リグレット保証を提供する。
  • 安定性および摂動解析を活用して、システム推定誤差下でもロバスト性を保証する。

実験結果

リサーチクエスチョン

  • RQ1オンラインアンサンブル構造における切替コストの制御を伴いながら、メモリを伴うOCOにおける動的ポリシーのリグレットを最小化することは可能か?
  • RQ2非定常的かつメモリ依存的なオンライン学習において、リグレットと切替コストの最適なトレードオフは何か?
  • RQ3提案されたアルゴリズムは、時間の長さ、非定常性、メモリ長に最適にスケーリングされるサブリニアな動的ポリシーのリグレットを達成できるか?
  • RQ4時間変動するポリシーに適応可能な、理論的保証付きの競合可能な制御則を設計することは可能か?
  • RQ5提案手法は、制御系におけるモデル推定誤差下でも、安定性と性能をどのように維持するか?

主な発見

  • 提案アルゴリズムは、最適な動的ポリシーのリグレットバウンド $ O(\sqrt{T} + \sqrt{V_T} + \sqrt{m}) $ を達成する。ここで $ T $ は時間の長さ、$ V_T $ は非定常性の測度、$ m $ はメモリ長である。
  • メタ・ラーナーにおける新しい正則化により、切替コストが明示的に制御され、アンサンブル構造における移動の線形スケーリングが防止される。
  • 本アルゴリズムは、オンライン非確率的制御における動的ポリシーのリグレット保証を初めて提供する。勾配ベースの制御則は、時間変動するポリシーと比較可能である。
  • 安定性解析により、有界なシステム推定誤差下でも、制御則が強く安定していることが示され、減衰率は $ \gamma - 2\kappa^3\varepsilon_{A,B} $ である。
  • モデル不確実性下でのシステム状態および摂動誤差に関する理論的バウンドが導出され、仮想システムにおける有界性が保証される。
  • すべての関連パラメータにおいてサブリニアなリグレットが達成され、非定常環境およびメモリ効果に対するロバスト性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。