Skip to main content
QUICK REVIEW

[論文レビュー] Achieving All with No Parameters: Adaptive NormalHedge

Haipeng Luo, Robert E. Schapire|arXiv (Cornell University)|Feb 20, 2015
Advanced Bandit Algorithms Research参考文献 27被引用数 9
ひとこと要約

本稿では、エキスパートの数や損失特性の事前知識がなくても、敵対的および確率的設定の両方で最適なレグレットを同時に達成するパラメータフリーのオンライン学習アルゴリズム、AdaNormalHedgeを提案する。NormalHedge.DTの改良版であり、任意の未知の固定コンペティターに対する相対エントロピーに基づくレグレットバウンドと、累積瞬時のレグレットに基づくバウンドを可能にし、エキスパートアドバイスおよびスリーピングエキスパート設定における未解決問題を強力な理論的保証とともに解消する。

ABSTRACT

We study the classic online learning problem of predicting with expert advice, and propose a truly parameter-free and adaptive algorithm that achieves several objectives simultaneously without using any prior information. The main component of this work is an improved version of the NormalHedge.DT algorithm (Luo and Schapire, 2014), called AdaNormalHedge. On one hand, this new algorithm ensures small regret when the competitor has small loss and almost constant regret when the losses are stochastic. On the other hand, the algorithm is able to compete with any convex combination of the experts simultaneously, with a regret in terms of the relative entropy of the prior and the competitor. This resolves an open problem proposed by Chaudhuri et al. (2009) and Chernov and Vovk (2010). Moreover, we extend the results to the sleeping expert setting and provide two applications to illustrate the power of AdaNormalHedge: 1) competing with time-varying unknown competitors and 2) predicting almost as well as the best pruning tree. Our results on these applications significantly improve previous work from different aspects, and a special case of the first application resolves another open problem proposed by Warmuth and Koolen (2014) on whether one can simultaneously achieve optimal shifting regret for both adversarial and stochastic losses.

研究の動機と目的

  • 敵対的および確率的損失環境の両方に対して、事前知識なしに適応可能な真にパラメータフリーのオンライン学習アルゴリズムの開発。
  • ε-分位数レグレットおよび相対エントロピーに基づくレグレットバウンドを含む、エキスパートアドバイスの文献における未解決問題の解消。
  • 時間変動するエキスパートの可用性に対応できるスリーピングエキスパート設定へのアルゴリズムの拡張。
  • 適応的レグレットおよび最良のプルーニングツリー予測といった実用的応用のためのレグレットバウンドの改善。

提案手法

  • 本アルゴリズムは、瞬時のレグレットの大きさに基づく新しいレグレット分解を用いて、重みを動的に調整するNormalHedge.DTの改良版である。
  • 累積瞬時のレグレットの大きさに基づくレグレットバウンドを導入しており、これは常にNormalHedge.DTのバウンド以下であり、2次のバウンド性能と一致する。
  • アルゴリズムは、コンペティターとプレーヤーの事前信念との間の相対エントロピーに基づくレグレットを保証し、任意のエキスパートの固定凸結合と普遍的に競合可能である。
  • エキスパートの可用性の時間変動をモデル化し、プルーニングツリーを用いた動的エキスパート表現を用いることで、スリーピングエキスパート設定への拡張を実現する。
  • 適応的レグレットおよび最良のプルーニングツリー問題への応用において、$L^*$ や $m$ の事前知識が不要な、新たな時間依存の学習率メカニズムを導入する。
  • 理論的解析により、レグレットバウンドが $\hat{O}\Big{(}\sqrt{m{\tilde{L}}^{*}\ln(N_{T}/m)}\Big{)}$ であることが示され、${\tilde{L}}^{*}$ は正の損失ギャップを表す。

実験結果

リサーチクエスチョン

  • RQ11つのパラメータフリーのアルゴリズムが、事前知識なしに敵対的および確率的損失環境の両方で最適なレグレットを達成できるか。
  • RQ2エキスパートアドバイス問題において、任意の未知の固定コンペティターに対して相対エントロピーに基づくレグレットバウンドを達成できるか。
  • RQ3時間変動するエキスパートの可用性と未知の総エキスパート数を考慮したスリーピングエキスパート設定に、アルゴリズムを拡張できるか。
  • RQ4AdaNormalHedgeは、ウォーマスとクーレン(2014)の未解決問題を解消し、敵対的および確率的損失の両方で最適な適応的レグレットを達成できるか。
  • RQ5$L^*$ や $m$ の知識が不要な状態で、既存の手法を上回る性能を達成できるか、最良のプルーニングツリー予測問題において。

主な発見

  • AdaNormalHedgeは、$\hat{O}\Big{(}\sqrt{m{\tilde{L}}^{*}\ln(N_{T}/m)}\Big{)}$ のレグレットバウンドを達成しており、$N_T \ll N$ の場合に、従来のバウンドよりも著しくタイトである。
  • アルゴリズムは、チャウドヒリら(2009)およびチェルノフとヴォフク(2010)の未解決問題を解決し、任意の固定コンペティターに対して相対エントロピーに基づくレグレットバウンドを提供する。
  • 損失パターンの事前知識が不要な状態で、確率的設定ではほぼ定常なレグレットを達成し、コンペティターの損失が低い場合に小さなレグレットを実現する。
  • アルゴリズムは効率的であり、1ラウンドあたり $O(\|x_t\|_{\mathcal{G}})$ の時間と $O(N_T)$ の空間を要し、エキスパート数や $L^*$ を事前に知る必要がない。
  • 最良のプルーニングツリー問題において、$L^*$ や $m$ を事前に知らない状態でも、最適な $O(\sqrt{mL^*})$ バウンドと同等のレグレットバウンドを達成する。これは、従来の動的計画法とは対照的である。
  • アルゴリズムはウォーマスとクーレン(2014)の未解決問題を解消し、1つのアルゴリズムで敵対的および確率的損失の両方で最適なシフトレグレットを実現可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。