Skip to main content
QUICK REVIEW

[論文レビュー] Online Learning with Continuous Variations: Dynamic Regret and Reductions

Ching-An Cheng, Jonathan Lee|arXiv (Cornell University)|Feb 19, 2019
Advanced Bandit Algorithms Research参考文献 39被引用数 7
ひとこと要約

本稿では、学習者の意思決定に応じて損失関数が連続的に変化する新しいオンライン学習フレームワークである連続的オンライン学習(COL)を提案する。これにより、変動予算の事前知識がなくても、動的リグレットの非線形性を達成できる。本稿は、非線形動的リグレットと変分不等式(VI)の間の根本的な同等性を確立し、適応的・確率的設定における静的リグレットおよび均衡問題への還元を提供することで、新たな収束保証を実現する。

ABSTRACT

Online learning is a powerful tool for analyzing iterative algorithms. However, the classic adversarial setup sometimes fails to capture certain regularity in online problems in practice. Motivated by this, we establish a new setup, called Continuous Online Learning (COL), where the gradient of online loss function changes continuously across rounds with respect to the learner's decisions. We show that COL covers and more appropriately describes many interesting applications, from general equilibrium problems (EPs) to optimization in episodic MDPs. In particular, we show monotone EPs admits a reduction to achieving sublinear static regret in COL. Using this new setup, we revisit the difficulty of sublinear dynamic regret. We prove a fundamental equivalence between achieving sublinear dynamic regret in COL and solving certain EPs. With this insight, we offer conditions for efficient algorithms that achieve sublinear dynamic regret, even when the losses are chosen adaptively without any a priori variation budget. Furthermore, we show for COL a reduction from dynamic regret to both static regret and convergence in the associated EP, allowing us to analyze the dynamic regret of many existing algorithms.

研究の動機と目的

  • 損失関数の連続的正則性をモデル化することで、任意の変動予算を想定する敵対的設定に代わるオンライン学習のギャップを埋める。
  • 古典的な境界が失効するか無意味になる可能性がある適応的・確率的環境において、非線形動的リグレットを達成する。
  • 動的リグレット最小化と変分不等式(VI)の解との間の明示的関係を確立する、特に強単調なVIに対して。
  • 動的リグレットから静的リグレットおよび関連均衡問題への収束への還元を形式的に確立し、既存のアルゴリズムの分析を可能にする。
  • 現実的な確率的フィードバック下でのオンライン模倣学習に対して、非漸近的収束速度および非線形リグレットバウンドを導出する。

提案手法

  • COLを、ラウンド n の損失が、x に関して連続的微分可能である双関数 f_x(x') によって定義されるオンライン学習設定として定義し、意思決定に応じた損失の滑らかな変化を保証する。
  • 強い単調性および滑らかさを特徴付けるために、(α,β)-正則性の概念を導入し、収束保証を可能にする。
  • 動的リグレットから静的リグレットおよび VI 収束への還元を活用し、既知の静的リグレットバウンドを用いて既存のアルゴリズムの分析を可能にする。
  • 特定のステップサイズ則 η = (α−β)/(γ+β)² を用いたミラー降下(オンライン勾配降下と同等)により、決定的フィードバック下で最適方策への線形収束および非線形動的リグレットを達成する。
  • 勾配推定値を真の勾配のノイズ付き観測とモデル化し、2次のモーメントが有界であることを仮定することで、確率的フィードバックへの拡張を実現する。
  • 還元フレームワークを用いて、ステップサイズ η_n = 1/√n の下で、期待動的リグレットに対して O(√N) のバウンドを導出する。

実験結果

リサーチクエスチョン

  • RQ1変動予算の事前知識がなくても、適応的オンライン学習設定で非線形動的リグレットを達成できるか?
  • RQ2連続的オンライン学習における非線形動的リグレットを実現するための損失関数の構造的条件は何か?
  • RQ3COL における動的リグレットは、変分不等式(VI)の解とどのように関連しているか?
  • RQ4COL において、動的リグレットから静的リグレットおよび VI 収束への還元を形式的に確立できるか?
  • RQ5COL フレームワーク下で、確率的フィードバック下でのオンライン模倣学習に対して、非漸近的収束速度およびリグレットバウンドをどのように導出できるか?

主な発見

  • COL in における非線形動的リグレットは、本質的に変分不等式(VI)の解法と同等であり、特に VI が強単調である場合には顕著である。
  • α > β のとき、一意な方策 ̂π が自身の分布上で最適であることが保証され、オンライン模倣学習問題の適切な定式化が可能になる。
  • 決定的フィードバックおよびステップサイズ η = (α−β)/(γ+β)² の下で、オンライン勾配降下アルゴリズムは ̂π へ線形収束を達成し、非線形動的リグレット(実際には O(1))を実現する。
  • ステップサイズ η_n = 1/√n の下で確率的フィードバックが与えられる場合、期待動的リグレットは O(√N) で有界であり、従来の漸近的収束結果を改善する。
  • 従来の研究が α/γ > 2β/α というより強い条件を要していたのに対し、本稿のフレームワークは α > β のみを要件としており、オンライン模倣学習の条件を改善する。
  • 還元フレームワークにより、動的リグレットを静的リグレットおよび VI 収束に結びつけることで、既存のアルゴリズムの直接的分析が可能となり、より広範な適用可能性が得られる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。