Skip to main content
QUICK REVIEW

[論文レビュー] Tight Lower Bounds for Multiplicative Weights Algorithmic Families

Nick Gravin, Yuval Peres|arXiv (Cornell University)|Jul 11, 2016
Coding theory and cryptography被引用数 4
ひとこと要約

本稿は、expert予測問題における乗法的重みアルゴリズム族のタイトなレグレット下界を確立し、新たな悪意あるプリミティブを用いて、古典的乗法的重みアルゴリズムが正確に $\sqrt{\frac{T\ln k}{2}}$ のレグレットを達成することを証明する。これにより、長年の上界と下界のギャップが完全に埋められる。さらに、時間的に変化するか、確率的に分布する学習率を有するより広い族に対しては $\frac{2}{3}$-要因の下界を示し、幾何的ホライズン設定における正確なレグレットを同定する。

ABSTRACT

We study the fundamental problem of prediction with expert advice and develop regret lower bounds for a large family of algorithms for this problem. We develop simple adversarial primitives, that lend themselves to various combinations leading to sharp lower bounds for many algorithmic families. We use these primitives to show that the classic Multiplicative Weights Algorithm (MWA) has a regret of $\sqrt{\frac{T \ln k}{2}}$, there by completely closing the gap between upper and lower bounds. We further show a regret lower bound of $\frac{2}{3}\sqrt{\frac{T\ln k}{2}}$ for a much more general family of algorithms than MWA, where the learning rate can be arbitrarily varied over time, or even picked from arbitrary distributions over time. We also use our primitives to construct adversaries in the geometric horizon setting for MWA to precisely characterize the regret at $\frac{0.391}{\sqrtδ}$ for the case of $2$ experts and a lower bound of $\frac{1}{2}\sqrt{\frac{\ln k}{2δ}}$ for the case of arbitrary number of experts $k$.

研究の動機と目的

  • 有限ホライズンにおけるexpert予測問題における、古典的乗法的重みアルゴリズム(MWA)の既知の上界と下界の間のギャップを埋めること。
  • 広範な学習アルゴリズム族に対して鋭いレグレット下界を導出可能な、悪意あるプリミティブの一般枠組みを構築すること。
  • 固定学習率にとどまらず、時間的に変化する、減少する、および確率的に選ばれる学習率を含む分析を拡張すること。
  • 停止がパrameter $\delta$ に対して記憶なしに発生する幾何的ホライズンモデルにおける、正確なレグレットを同定すること。

提案手法

  • 『ループ』や『直線』フェーズといった、専ら構造的で交互な専門家進捗のパターンに基づく悪意ある戦略を設計し、非最適な性能を強制する。
  • 漸近的近似とテイラー展開を用いて、$e^{\eta(t)} = 1 + \frac{\alpha(t)}{\sqrt{T}}$ かつ $\alpha(t) = \Theta(1)$ を仮定したもとでのレグレット式の推定を行う。
  • 変分法と積分近似を用いて、時間経過に伴うレグレット寄与の和をバウンドし、$\int_0^1 \sqrt{1-x} \, dx$ の形の積分に還元する。
  • 対称的専門家進捗と単一専門家集中の間を交互に切り替える悪意ある敵対戦略を構築し、レグレット寄与を分離・強調する。
  • ランダムパラメータ(例:ランダムな開始フェーズ)の確率的平均化を用いて、アルゴリズム族全体にわたる頑健な下界を導出する。
  • 問題を割引付き無限ホライズンマルコフ決定過程としてモデル化し、最適な敵対構造を導出することで、幾何的ホライズンへの結果の拡張を行う。

実験結果

リサーチクエスチョン

  • RQ1固定学習率を用いた古典的乗法的重みアルゴリズムが達成可能な正確なレグレットは何か?
  • RQ2時間的に変化するか、確率的に分布する学習率を有するアルゴリズム族に対して、レグレット下界はどのようにスケーリングするか?
  • RQ3一般のアルゴリズム族に対して、$\frac{2}{3}\sqrt{\frac{T\ln k}{2}}$ を超えるレグレット下界を改善できるか?
  • RQ4特に $k=2$ の場合に、$k$ 専門家に対する幾何的ホライズンモデルにおける正確なレグレットは何か?
  • RQ5構造的専門家進捗パターンに基づく悪意ある戦略は、下界導出にどのように影響を与えるか?

主な発見

  • 古典的乗法的重みアルゴリズムは、正確に $\sqrt{\frac{T\ln k}{2}}$ のレグレットを達成し、既知の上界と下界のギャップが完全に埋まる。
  • 任意の時間依存分布から学習率が選ばれるより広い族 $\mathcal{A}_{\text{rand}}$ に対して、レグレットは少なくとも $\frac{2}{3}\sqrt{\frac{T\ln k}{2}}$ である。
  • 奇数の $k$ に対しては、下界は $\frac{2}{3}\sqrt{\frac{T\ln k}{2}\left(1 - \frac{1}{k^2}\right)}$ であり、対称性の破れに起因するわずかな補正が反映されている。
  • $k=2$ 専門家を有する幾何的ホライズンモデルでは、$\delta \to 0$ のとき、最適なレグレットは正確に $\frac{0.391}{\sqrt{\delta}}$ である。
  • 一般の $k$ に対して幾何的ホライズンでは、レグレットは少なくとも $\frac{1}{2}\sqrt{\frac{\ln k}{2\delta}}$ である。
  • 下界を導出する上で、$e^{\eta(t)} = 1 + \frac{\alpha(t)}{\sqrt{T}}$ かつ $\alpha(t) = \Theta(1)$ の仮定は、一般性を失わずに行える。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。