Skip to main content
QUICK REVIEW

[論文レビュー] Policy Gradient Optimization of Thompson Sampling Policies

Seungki Min, Ciamac C. Moallemi|arXiv (Cornell University)|Jun 30, 2020
Advanced Bandit Algorithms Research参考文献 20被引用数 6
ひとこと要約

本稿では、事後分布のパラメータ抽出を「擬似行動」として扱うことにより、ポリシー勾配法を用いてトマソンサンプリング方策を最適化する手法を提案する。これにより、勾配ベースのサンプリング戦略の最適化が可能となり、過剰な探索を抑えるメタパラメータを学習することで、過剰な腕数や高ノイズ環境といった挑戦的なバンディット設定において、トマソンサンプリングの性能が向上し、数値実験で顕著なリグレットの低減が達成された。

ABSTRACT

We study the use of policy gradient algorithms to optimize over a class of generalized Thompson sampling policies. Our central insight is to view the posterior parameter sampled by Thompson sampling as a kind of pseudo-action. Policy gradient methods can then be tractably applied to search over a class of sampling policies, which determine a probability distribution over pseudo-actions (i.e., sampled parameters) as a function of observed data. We also propose and compare policy gradient estimators that are specialized to Bayesian bandit problems. Numerical experiments demonstrate that direct policy search on top of Thompson sampling automatically corrects for some of the algorithm's known shortcomings and offers meaningful improvements even in long horizon problems where standard Thompson sampling is extremely effective.

研究の動機と目的

  • トマソンサンプリングの既知の欠陥、特に短いホライズンや高腕数の設定における過剰な探索といった、標準的なTSが性能を発揮できない状況を是正すること。
  • ヒューリスティック設計を超えて、計算駆動によるトマソンサンプリング方策の自動的かつ体系的な改善を可能にする手法の開発。
  • 基本的な行動ではなく、事後分布パラメータ(擬似行動)の選択を意思決定として再定義することにより、トマソンサンプリング方策の族に対するポリシー勾配最適化を可能にすること。
  • 事前分布のハイパーパラメータや事後分布の形状といったメタパラメータを学習することで、ベイジアンバンディット問題において顕著な性能向上が達成されることの実証。

提案手法

  • トマソンサンプリングを二段階プロセスとして再定式化:まず、ポリシー依存の事後分布からパラメータ(擬似行動)を抽出し、次にそのパラメータのもとでの最適行動を選択する。
  • 抽出されたパラメータを意思決定変数として扱い、閉形式の事後密度を介してポリシー勾配法に適した行動分布を導出する。
  • サンプリングポリシーをメタパラメータ(例:事前分散、ノイズ分布の形状)でパラメータ化し、これらのハイパーパラメータに対する勾配ベースの最適化を可能にする。
  • ベイジアンバンディットに特化したポリシー勾配推定器を用いる。報酬指標には観測報酬、平均報酬、ベイズリグレットを用い、ベースラインにはヌルベースライン、オラクルベースライン、自己ベースラインを含む。
  • バッチ処理によるポリシー勾配上昇をAdam最適化子を用いて実行し、シミュレートされたバンディットエピソードから推定された確率的勾配を用いてメタパラメータを更新する。
  • 計算可能性を保証するため、メタパラメータに関するサンプリング分布の対数密度の微分が計算可能であることを要件とし、通常は密度が比例定数まで既知である場合に適用可能である。

実験結果

リサーチクエスチョン

  • RQ1標準的な定式化において行動分布が不確実であるにもかかわらず、ポリシー勾配法がトマソンサンプリング方策の最適化に効果的に適用可能かどうか。
  • RQ2ポリシー勾配推定における異なる報酬指標とベースラインが、学習されたトマソンサンプリング方策の収束性および性能に与える影響は。
  • RQ3事前分散や事後分布の形状といったメタパラメータを学習することで、腕数が多い、またはノイズが高い環境で特に性能が劣るとされるトマソンサンプリングの性能を、どの程度まで向上できるか。
  • RQ4サンプリング方策に対する直接的なポリシー探索が、長期間にわたるホライズンや極端な設定におけるトマソンサンプリングの過剰な探索を自動で是正できるか。
  • RQ5提案手法が、Bayes-UCB や OGI といった既存のバンディットアルゴリズムと同等またはそれ以上の性能向上を、挑戦的なバンディット環境で達成できるか。

主な発見

  • 高腕数設定(K=20, T=20)において、ナイーブなトマソンサンプリングは極端な過剰探索を示し、リグレットが28.802(標準誤差0.097)に達し、これは非効率な結果であった。
  • ポリシー勾配で最適化された方策では、平均報酬指標とオラクルベースラインを用いた場合、リグレットが20.348(標準誤差0.126)にまで低下し、ナイーブなTSを著しく上回った。
  • 学習された方策は、時間経過とともにプル分布を少ない腕に偏らせるよう調整し、探索を効果的に抑制していることが図4の可視化で示された。初期段階では均等な割り当てが、後期には特定の腕への集中が見られた。
  • 異なる報酬指標とベースラインでは最終的な性能に差はほとんどなかったが、初期段階の訓練ではヌルベースラインがオラクルベースラインを上回った。これは、オラクルベンチマークがタイトに達成可能ではないことを示唆している。
  • 本手法は、事後分布のサンプリング分布を再形状するメタパラメータを効果的に学習し、高次元または冗長な腕空間におけるトマソンサンプリングの過剰な探索傾向を是正した。
  • テストされた設定において、本手法はOGI や Bayes-UCB といった既存の最良手法に近い性能を達成し、ベイジアンバンディットにおける自動的ポリシー最適化の価値を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。