Skip to main content
QUICK REVIEW

[論文レビュー] Efficient tracking of a growing number of experts

Jaouad Mourtada, Odalric-Ambrym Maillard|arXiv (Cornell University)|Aug 31, 2017
Advanced Bandit Algorithms Research参考文献 19被引用数 8
ひとこと要約

本稿では、時間の経過とともに逐次的かつ予測不能に新規エキスパートが到着する状況において、リアルタイムで増加する数のエキスパートを追跡するための新しいオンライン学習アルゴリズムを提案する。『放棄のトリック』と新しい『マイトリングのトリック』を組み合わせ、パrameterの適応的チューニングを施すことで、理論的に最適でありながら実用的にも効率的なタイトなレグレットバウンドを達成する。また、エキスパート総数や時間枠の事前知識がなくても、1ラウンドあたり線形時間・線形空間計算量を維持する。

ABSTRACT

We consider a variation on the problem of prediction with expert advice, where new forecasters that were unknown until then may appear at each round. As often in prediction with expert advice, designing an algorithm that achieves near-optimal regret guarantees is straightforward, using aggregation of experts. However, when the comparison class is sufficiently rich, for instance when the best expert and the set of experts itself changes over time, such strategies naively require to maintain a prohibitive number of weights (typically exponential with the time horizon). By contrast, designing strategies that both achieve a near-optimal regret and maintain a reasonable number of weights is highly non-trivial. We consider three increasingly challenging objectives (simple regret, shifting regret and sparse shifting regret) that extend existing notions defined for a fixed expert ensemble; in each case, we design strategies that achieve tight regret bounds, adaptive to the parameters of the comparison class, while being computationally inexpensive. Moreover, our algorithms are anytime, agnostic to the number of incoming experts and completely parameter-free. Such remarkable results are made possible thanks to two simple but highly effective recipes: first the "abstention trick" that comes from the specialist framework and enables to handle the least challenging notions of regret, but is limited when addressing more sophisticated objectives. Second, the "muting trick" that we introduce to give more flexibility. We show how to combine these two tricks in order to handle the most challenging class of comparison strategies.

研究の動機と目的

  • 古典的な固定エキスパートフレームワークではカバーされていない、時間の経過とともに動的に新規エキスパートが到着する状況におけるオンライン予測とエキスパートアドバイスの課題に対処すること。
  • アクティブなエキスパート数に比例して効率的にスケーリングするアルゴリズムを設計し、指数的計算コストを回避すること。
  • 標準的なレグレットの概念(単純レグレット、シフトレグレット、スパースシフトレグレット)を、エキスパートプールが進化する動的エキスパート設定に拡張すること。
  • アルゴリズムがいつでも適用可能であり、エキスパート総数に依存せず、パrameterフリーであることを保証し、チューニングなしで実用的導入を可能にすること。
  • 専門家フレームワークとスリーピングエキスパートフレームワークの既存結果を、単一のスケーラブルなアルゴリズムフレームワークで統合・一般化すること。

提案手法

  • 専門家学習から着想を得た『放棄のトリック』を導入し、エキスパートが非アクティブな際には予測を放棄することで、基本的なレグレット目的を扱う。
  • 複雑な比較クラス、特に複数のエキスパートを追跡する際やそれらの間を切り替える際の柔軟性を高めるために、新規の『マイトリングのトリック』を提案する。
  • マコビアン遷移ルールとエキスパート固有の重み、および時変パrameter αt と βt を組み合わせた、GrowingSleepingMarkovHedgeアルゴリズムを設計する。
  • 各エキスパートに対して事前重み πi を設定し、各ラウンドで動的に正規化することで、計算効率と安定性を維持する。
  • 損失依存の更新を伴う再正規化指数的重み付け方式を適用する:vt+1(i,a) = Σb θi,t+1(a|b) vt^m(i,b),ここで vt^m は正規化された重み更新を表す。
  • アクティブなエキスパートのみを追跡し、重みを段階的に更新することで、1ラウンドあたり O(Mt) の線形時間・線形空間計算量を維持する。

実験結果

リサーチクエスチョン

  • RQ1時間の経過とともに新規エキスパートが導入される状況において、最良のエキスパートを効率的に追跡できるオンライン学習アルゴリズムはどのように設計できるか?
  • RQ2エキスパート集合が動的に拡大する状況において、シフトレグレットの概念を拡張可能か。もし可能であれば、タイトなレグレットバウンドを達成するにはどうすればよいか?
  • RQ3アクティブなエキスパート数に線形に比例する計算複雑性を維持しながら、低レグレットを実現するための技術は何か?
  • RQ4専門家フレームワークとスリーピングエキスパートフレームワークを統合し、新規エキスパートの到着とエキスパートの非アクティブ状態の両方を効果的に処理するにはどうすればよいか?
  • RQ5未知の時間枠と変化するエキスパートプールに適応できるパrameterフリーでいつでも適用可能なアルゴリズムを設計することは可能か?

主な発見

  • GrowingSleepingMarkovHedgeアルゴリズムは、事前重み、αt、βt、シフト時刻を含む対数的項の和に比例する O(1/η) のレグレットバウンドを達成し、比較クラスのパrameterにタイトな依存関係を示す。
  • レグレットバウンドはエキスパート数、最良エキスパートシーケンスにおけるシフト回数、新規エキスパートの到着時刻に適応し、ほぼ最適性を達成する。
  • アルゴリズムは1ラウンドあたり O(Mt) の時間・空間計算量を維持する。ここで Mt は時刻 t におけるアクティブなエキスパート数である。このため、スケーラブルで実用的である。
  • αt = βt = 1/t かつ πi = 1/(τi m_{τi}) と設定することで、先行研究で知られている最適レグレットバウンド (7) を特別な場合として回復する。
  • 『マイトリングのトリック』の使用により、従来の手法が効率的にサポートできなかったような、スパースシフト戦略のような複雑な比較クラスも処理可能になる。
  • アルゴリズムは事前重みのスケーリングに対して不変であり、性能に影響を与えることなく正規化が可能である。また、完全にパrameterフリーかついつでも適用可能な性質を有する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。