Skip to main content
QUICK REVIEW

[論文レビュー] Online mirror descent and dual averaging: keeping pace in the dynamic case

Fang Huang, Nicholas J. A. Harvey|arXiv (Cornell University)|Jun 3, 2020
Advanced Bandit Algorithms Research参考文献 23被引用数 19
ひとこと要約

本稿では、動的学習率下で、従来達成されていなかった、オンラインミラー降下(OMD)とデュアル平均化(DA)のレジレット性能のギャップを埋める安定化技術を導入する。古典的なOMD収束解析をモジュラーな方法で修正することで、著者らは、複数の設定(特にエキスパートアドバイスや複合コスト関数)において、安定化OMDがDAと同等の非線形レジレットバウンドを達成することを示した。また、2つのアルゴリズムが同一の反復を生成するための条件も提示した。

ABSTRACT

Online mirror descent (OMD) and dual averaging (DA) -- two fundamental algorithms for online convex optimization -- are known to have very similar (and sometimes identical) performance guarantees when used with a fixed learning rate. Under dynamic learning rates, however, OMD is provably inferior to DA and suffers a linear regret, even in common settings such as prediction with expert advice. We modify the OMD algorithm through a simple technique that we call stabilization. We give essentially the same abstract regret bound for OMD with stabilization and for DA by modifying the classical OMD convergence analysis in a careful and modular way that allows for straightforward and flexible proofs. Simple corollaries of these bounds show that OMD with stabilization and DA enjoy the same performance guarantees in many applications -- even under dynamic learning rates. We also shed light on the similarities between OMD and DA and show simple conditions under which stabilized-OMD and DA generate the same iterates.

研究の動機と目的

  • 動的学習率下で、オンラインミラー降下(OMD)とデュアル平均化(DA)の間の根本的な性能ギャップを解消すること。
  • OMDが線形レジレットを示す一方でDAが非線形O(√T)レジレットを維持するというギャップを埋めること。
  • 収束性を保ちつつ、OMDとDAの理論的解析を統一する安定化技術を導入することで、OMDとDAの理論的分析を統一すること。
  • プロキシマル変種を用いて、複合コスト関数への解析を拡張すること。
  • 安定化OMDとDAが同一の反復を生成する十分条件を特定すること。

提案手法

  • 動的学習率下での性能向上を図るため、OMDの更新ルールを変更する安定化技術を導入すること。
  • 古典的なOMD収束解析をモジュラーかつ柔軟な方法で再定式化し、安定化を組み込むこと。
  • 反復間のブレグマン発散にのみ依存する抽象的なレジレットバウンドを安定化OMDについて導出すること。このバウンドはDAのものと一致する。
  • 安定化OMDフレームワークを用いて、エキスパートアドバイスおよび複合最適化設定における一致するレジレットバウンドを証明すること。
  • 安定化OMDとDAが同一の反復を生成する条件を確立し、固定学習率の場合と同様の性質を再現すること。
  • プロキシマル変種を用いて、複合コスト関数の解析を拡張すること。

実験結果

リサーチクエスチョン

  • RQ1OMDは、動的学習率下でDAと同等のレジレット性能を達成できるか。かつてOMDは線形レジレットを示していた。
  • RQ2OMDの更新ルールに必要な構造的変更は何か。DAとのレジレットギャップを埋めるのに十分である。
  • RQ3安定化OMDとDAが時間変動する学習率下でも同一の反復を生成する条件は何か。
  • RQ4安定化OMDフレームワークは、複合最適化問題において正則化DAと同等のレジレットバウンドを達成できるか。
  • RQ5ブレグマン発散は、OMDとDAのレジレット解析を統一する役割を果たすか。

主な発見

  • 安定化OMDは、動的学習率下でもDAと同等のO(√T)レジレットバウンドを達成し、知られていた性能ギャップを解消した。
  • エキスパートアドバイスの設定において、安定化OMDは動的学習率下でも、O(√T ln n)という最良の既知のレジレットバウンドを達成した。
  • 著者らは、安定化OMDが1次レジレットバウンドを達成することを示す簡潔な証明を提供した。このバウンドはTではなく、最良のエキスパートのコストに依存する。
  • 著者らは、安定化OMDとDAが同一の反復を生成する簡単な十分条件を同定し、両者の振る舞いを統一した。
  • 複合コスト関数の設定では、デュアル安定化OMDのプロキシマル変種が、正則化DAと同等のレジレットバウンドを達成した。
  • 解析により、標準的なOMDが動的レート下でΩ(T)のレジレット下限を示すことが回避され、非線形レジレットが達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。