Skip to main content
QUICK REVIEW

[論文レビュー] Differentiable Bandit Exploration

Craig Boutilier, Chih‐Wei Hsu|arXiv (Cornell University)|Feb 17, 2020
Advanced Bandit Algorithms Research参考文献 46被引用数 5
ひとこと要約

この論文は、未知の事前分布 P に関する強い仮定を必要とせず、問題インスタンスの分布上でのベイズ報酬を最適化することで、ベイジアンマルチアームバンディットにおける最適な探索方策を学習する微分可能で勾配に基づくアプローチを提案する。新規の微分可能ソフトマックス方策である SoftElim を提案し、分散低減を施した方策勾配を用いてニューラルネットワークや他の方策を学習する。その結果、標準的なベースラインと比較して低いベイズレグレットを達成するとともに、データ分布からの暗黙のバイアスを学習することが可能となった。

ABSTRACT

Exploration policies in Bayesian bandits maximize the average reward over problem instances drawn from some distribution $\mathcal{P}$. In this work, we learn such policies for an unknown distribution $\mathcal{P}$ using samples from $\mathcal{P}$. Our approach is a form of meta-learning and exploits properties of $\mathcal{P}$ without making strong assumptions about its form. To do this, we parameterize our policies in a differentiable way and optimize them by policy gradients, an approach that is general and easy to implement. We derive effective gradient estimators and introduce novel variance reduction techniques. We also analyze and experiment with various bandit policy classes, including neural networks and a novel softmax policy. The latter has regret guarantees and is a natural starting point for our optimization. Our experiments show the versatility of our approach. We also observe that neural network policies can learn implicit biases expressed only through the sampled instances.

研究の動機と目的

  • 事前分布 P について強い仮定を必要としない、一般化された微分可能なフレームワークを構築し、バンディット探索方策を学習すること。
  • 方策勾配を用いて最大のベイズ報酬を達成する方策を最適化し、確率的最適化によりエンドツーエンドの学習を可能にすること。
  • 理論的レグレット保証と最適化のしやすさを備えた、新しい微分可能なバンディット方策 SoftElim を設計すること。
  • ニューラルネットワークが、明示的な教師信号なしにデータ分布からの暗黙のバイアスを学習できることを示すこと。
  • バンディット構造に特化したベースラインと新規の分散低減技術を用いて、バンディット方策最適化における勾配の分散を低減すること。

提案手法

  • ニューラルネットワークや新規のソフトマックス方策(SoftElim)を含む微分可能な関数を用いてバンディット方策をパrameter化し、行動確率を推定された非最適性ギャップとカウントに依存させる。
  • 未知の事前分布 P からサンプリングされた問題インスタンスの上での累積報酬の期待値としてベイズ報酬を定式化し、方策勾配法を用いて最適化する。
  • 尤度比トリックを用いて報酬勾配を導出し、バンディット設定に特化した2つの分散低減ベースライン(自己ベースラインと最適後悔ベースライン)を導入する。
  • 行動 i を引く確率が exp(θ × (max_j μ_j - μ_i)^2 × T_i) に比例する微分可能な方策である SoftElim を導入し、理論的レグレット保証を備えた楽観的探索を可能にする。
  • サンプルされたエピソードからの勾配の経験的推定を用い、確率的勾配上昇法で方策パラメータを学習する。
  • 合成的および実世界のバンディット問題に対して本手法を評価し、UCB1、トムソンサンプリング、Exp3 と性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1微分可能な方策勾配を用いてベイズ報酬を最適化することで、ベイジアンバンディットにおける効果的な探索方策を学習できるか?
  • RQ2SoftElim のような微分可能なソフトマックス方策は、サブラインアーなレグレットを達成すると同時に、勾配に基づく最適化に適しているか?
  • RQ3バンディット構造に特化した分散低減技術は、方策勾配学習のサンプル効率と収束性を向上させるのにどの程度有効か?
  • RQ4ニューラルネットワーク方策は、明示的な教師信号なしに事前分布 P からの複雑な暗黙のバイアスを学習できるか?
  • RQ5ベイズ報酬の目的関数は方策パラメータに関して凹型であり、勾配上昇法による収束保証が得られるか?

主な発見

  • 提案手法 GradBand は、さまざまな問題インスタンスにおいて、UCB1 や Thompson Sampling や Exp3 よりも低いベイズレグレットを達成するバンディット方策を効果的に学習した。
  • SoftElim 方策は θ=8 のとき O(1) のレグレット定数を達成し、先行研究の O(KΔ⁻⁴) の境界を著しく上回り、勾配降下による容易な最適化が可能である。
  • 方策勾配学習により訓練されたニューラルネットワーク方策は、非最適なアームを無視し、関連のあるアームに注目するよう学習し、データ分布からの暗黙のバイアスを捉える能力を示した。
  • 後悔の最適なヒンターレースベースライン(b^opt)と自己ベースラインの使用により、勾配の分散が顕著に低減され、学習の安定性と収束速度が向上した。
  • 経験的結果から、RNN を用いた方策を用いる場合、アーム数 K の増加に伴いベイズレグレットが増加しないことが示された。これは古典的手法とは対照的であり、関連するアームへの注目が学習されたためである。
  • 本手法は、構造的または高次元の事前分布を有する多様なバンディット問題に対しても一般化が良く、広範な適用可能性を示唆している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。