Skip to main content
QUICK REVIEW

[論文レビュー] Connections Between Mirror Descent, Thompson Sampling and the Information Ratio

Julian Zimmert, Tor Lattimore|arXiv (Cornell University)|May 28, 2019
Advanced Bandit Algorithms Research参考文献 24被引用数 8
ひとこと要約

本稿は、情報比を介した情報理論的解析と勾配の鏡映(MD)の間の正式な関係を確立し、トフスン・サブスクリプション(Thompson Sampling)におけるベイジアンレグレットバウンドが、オンライン確率的鏡映勾配(OSMD)の道具を用いて導出可能であることを示している。本稿では、$k$-アームドバンディットにおける情報理論的レグレットバウンドに一致するように変更されたトフスン・サブスクリプションアルゴリズムを導入し、従来のOSMDバウンドに対して $\frac{1}{2}$-要因の改善を達成するとともに、$\pi$-ボールやグラフフィードバックバンディットにおけるレグレットを改善している。

ABSTRACT

The information-theoretic analysis by Russo and Van Roy (2014) in combination with minimax duality has proved a powerful tool for the analysis of online learning algorithms in full and partial information settings. In most applications there is a tantalising similarity to the classical analysis based on mirror descent. We make a formal connection, showing that the information-theoretic bounds in most applications can be derived from existing techniques for online convex optimisation. Besides this, for $k$-armed adversarial bandits we provide an efficient algorithm with regret that matches the best information-theoretic upper bound and improve best known regret guarantees for online linear optimisation on $\ell_p$-balls and bandits with graph feedback.

研究の動機と目的

  • 情報理論的解析(情報比を介して)とオンライン確率的鏡映勾配(OSMD)の間の正式な関係を確立すること。
  • $k$-アームドバンディットにおけるベイジアンレグレットバウンドとOSMDレグレットバウンドの間の恒久的な2倍のギャップの原因を説明すること。
  • 敵対的 $k$-アームドバンディットに対して、情報理論的上界に一致する構成的かつ効率的なアルゴリズムを開発すること。
  • 統一フレームワークを用いて、グラフフィードバックバンディットおよび $\ell_p$-ボール上のオンライン線形最適化におけるレグレット保証を改善すること。
  • 鏡映勾配の関係を通じて、ベイジアン解析の技術を敵対的オンライン学習へと転送可能にする。

提案手法

  • OSMDと同一のサンプリング戦略を用いるが、ベイジアン更新ルールを適用することで、ハイブリッドアルゴリズムを構築する。
  • OSMDの安定性解析ツールを適用して情報比をバウンドし、古典的凸解析と情報理論的レグレットバウンドを結びつける。
  • ミニマックス双対性とBregman発散に基づく情報ゲインを用いてレグレットバウンドを導出し、特定のポテンシャル関数下でOSMDと同等であることを示す。
  • 次元に依存しないレグレットを達成するため、$F(x) = \sum_i h(x_i)$ のような区分的構造を持つ新しいポテンシャル関数を設計する。
  • グラフフィードバックバンディット用に、情報ゲイン推定を改善するための修正されたロス推定子 $E_t(x,a)$ を導入する。
  • 学習率やパラメータ(例:$\alpha = 1 - 1/\log k$)を調整して、異なる設定におけるレグレットバウンドを最適化する。

実験結果

リサーチクエスチョン

  • RQ1なぜ情報理論的バウンドとOSMDスタイルの解析が、$k$-アームドバンディットにおいてほぼ同一のレグレットバウンドをもたらすのか?
  • RQ2情報理論的解析を用いて、非構成的バウンドと実用的アルゴリズムのギャップを埋める効率的OSMDアルゴリズムを構築可能か?
  • RQ3敵対的バンディットにおけるベイジアンレグレットとOSMDレグレットの間の恒久的な2倍の差の原因は何か?
  • RQ4情報理論的フレームワークを用いて、$\ell_p$-ボール上のオンライン線形最適化におけるレグレットバウンドを改善可能か?
  • RQ5情報比解析をグラフフィードバックバンディットに適応することで、対数的依存性を低減可能か?

主な発見

  • 鏡映勾配と情報理論的解析の間の正式な関係が確立され、OSMDの安定性ツールが情報比をバウンド可能であることが示された。
  • $k$-アームドバンディットにおけるベイジアンレグレットとOSMDレグレットの2倍ギャップは完全に解明され、$\mathfrak{R}_n \leq \sqrt{2kn} + O(k)$ のようなバウンドが達成され、情報理論的上界と一致した。
  • グラフフィードバックバンディットでは、$\log n$ 要因の改善が達成され、ハードケースでは $\mathcal{O}(\sqrt{\mathcal{G}_{\text{ind}} n \log(k)^3})$ を達成した。
  • $p \in [1,2]$ の $\ell_p$-ボール上のオンライン線形最適化において、新しいポテンシャル関数により、先行研究と比較して任意に大きな定数要因の改善が達成された。
  • $k$-アームドバンディット用に開発された新しいアルゴリズムは効率的であり、既知の最高の情報理論的バウンドに一致し、長年の文献上のギャップを解消した。
  • 統一フレームワークにより、ベイジアンレグレット解析の技術を敵対的オンライン学習へと転送可能となり、構成的アルゴリズム設計の新たな道筋を開いた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。